
Tiến tới những chuẩn mở trong việc xử lý giọng nói
Giới thiệu
Nhiều dự án phần mềm có từ lâu đã sử dụng các tệp tài nguyên và cấu hình flat-file (thuật ngữ
thường dùng để chỉ các ứng dụng lưu trữ dữ liệu lên các tập tin dạng văn bản) trong nhiều năm
mà không gặp các vấn đề lớn. Khi các dự án phát triển và trở nên phức tạp hơn, nhu cầu tăng
thêm về sự chặt chẽ và tính tương thích càng lớn hơn. Với XML và ứng dụng của XML khi sử
dụng các tiêu chuẩn cụ thể, có khả năng là bạn có thể được hưởng lợi từ: tính tương thích, tính
chắc chắn và tính mở rộng giữa dự án và giữa nền tảng trong các lĩnh vực chẳng hạn như
Unicode.
Các từ viết tắt thông dụng
HTK: Hidden Markov Model Toolkit (Bộ công cụ mô hình Markov ẩn)
PLS: Pronunciation Lexicon Specification (Đặc tả từ vựng phát âm)
XML: eXtensilble Markup Language (Ngôn ngữ đánh dấu mở rộng)
Bằng việc chuyển đổi các tệp flat-file sang tiêu chuẩn nguồn mở thích hợp, bạn cũng có thể làm
tăng tính linh hoạt và độ tin cậy. Từ ngữ trong việc nhận dạng giọng nói là một ví dụ hay được
sử dụng trong bài này. Dù các dự án mã nguồn mở của bạn có di chuyển sang XML với các tệp
tài nguyên hay không, bạn có thể sử dụng các tiêu chuẩn XML trong công việc của mình mà
không bị mất đi các đặc tính.
Trong bài này, hãy tìm hiểu cách dễ dàng di chuyển giữa các định dạng phẳng và PLS. Các ví dụ
cho thấy cách lưu trữ các từ ngữ tùy chỉnh theo định dạng PLS và trích xuất dữ liệu vào flat-file
cần thiết.
Về đầu trang
Ví dụ: Từ ngữ
Các từ ngữ là các danh sách của các từ mà bạn sử dụng trong các công cụ nhận dạng giọng nói.
Chúng chứa thông tin về cách từ đó phải được in ra hoặc được biểu diễn bằng đồ họa như thế
nào và nó phát ra như thế nào khi sử dụng các âm vị. Từ vựng thường dùng với HTK được sử
dụng rộng rãi trong các dự án điều khiển bằng giọng nói (xem phần Tài nguyên). Liệt kê 1 là một
đoạn trích của một từ vựng HTK của VoxForge.
Liệt kê 1. Đoạn trích của một từ vựng HTK của VoxForge
AGENCY [AGENCY] ey jh ih n s iy
AGENDA [AGENDA]
ax jh eh n d ax
AGENT [AGENT] ey jh ih n t
AGENTS [AGENTS] ey jh ih n t s
AGER [AGER] ey g er

AGES [AGES] ey jh ih z
Thêm một khoảng tab nếu bạn muốn sao chép và dán mã
trong bài
Điều quan trọng là bạn lấy các từ vựng trực tiếp từ nguồn. Bài này sẽ hiển thị bằng HTML, thay
thế các sự phân cách bằng khoảng trống. Nếu bạn sao chép và dán từ bài này, bạn cần phải thay
thế nhiều khoảng trống ở giữa bằng một dấu phân cách thẻ đơn (\t) nếu không thì đoạn script sẽ
không chạy.
Tệp trong Liệt kê 1 có ba trường được phân cách bằng tab:
Nhãn mô tả chung về từ đó.
Các dấu ngoặc vuông bao quanh từ khi bạn muốn nó được in hoặc được hiển thị trên màn
hình (grapheme - chữ cái đặc trưng cho một âm vị).
Một chuỗi các âm vị có phân cách bằng một khoảng trống từ bộ Arpabet (xem phần Tài
nguyên) mô tả từ này phát âm như thế nào.
Trong ví dụ trên, các phát âm từ tiếng Anh, rõ ràng được trình bày bởi các ký tự ASCII (Mã tiêu
chuẩn Hoa kỳ dùng để trao đổi thông tin)..
Dự án Sphinx của CMU (xem phần Tài nguyên) lưu từ vựng (hoặc từ điển trong bối cảnh Sphinx
của CMU) theo cách tương tự. Liệt kê 2 trình bày một đoạn trích dẫn.
Liệt kê 2. Đoạn trích từ vựng Sphinx của CMU
agency EY JH AH N S IY
agenda AH JH EH N D AH
agendas AH JH EH N D AH Z
agent EY JH AH N T
agents EY JH AH N T S
ager EY JH ER
Trong Liệt kê 2 chỉ có hai trường: word/grapheme và biểu diễn âm vị của nó. Hai ví dụ trên có
một số sự khác biệt khó nhận thấy:
Các từ và các âm vị trong các trường hợp khác nhau.
Các âm vị có một số khác biệt không đáng kể.
Dấu chấm câu (dấu phẩy, dấu chấm than và v.v) được xử lý hơi khác nhau một chút.
Bạn có thể xem toàn bộ từ điển trong tệp cmu07a.dic trong phần tải về hiện tại của PocketSphinx
(xem phần Tài nguyên).

Do từ vựng mô tả các cách phát âm cụ thể của các từ, nên bạn có thể cần chỉnh sửa tệp đó cho
phù hợp với mọi người hoặc các phương ngữ cụ thể. Theo thời gian, bạn xây dựng vốn kiến thức
trong từ vựng tùy chỉnh riêng của mình. Bạn có thể dễ dàng chỉnh sửa flat-file bằng một trình
soạn thảo văn bản, nhưng bạn nên cẩn thận vì điều này cũng dễ gây ra lỗi, chẳng hạn như: việc
sử dụng một dấu phân cách khác hơn so với tiêu chuẩn dùng cho tệp, việc chèn các ký tự không
phải là ASCII, đặt các trường theo thứ tự sai, việc phân loại các bản ghi không chính xác, thiếu
các dấu ngoặc vuông cần thiết và v.v.
Có một bất lợi khó thấy khác của các flat-file là khi bạn xây dựng tệp tùy chỉnh của mình, bạn
vẫn không tương thích với các dự án nhận dạng văn bản khác. Một từ vựng theo một định dạng
XML tiêu chuẩn như PLS, nếu được cả hai dự án công nhận, thì ngay lập tức đều tương thích
trong cả hai.
Về đầu trang
Đặc tả từ vựng phát âm
PLSA có một định dạng cơ bản, đơn giản như trong Liệt kê 3.
Liệt kê 3. Định dạng PLS cơ bản
<?xml version="1.0" encoding="UTF-8"?>
<lexicon version="1.0"
xmlns="http://www.w3.org/2005/01/pronunciation-lexicon"
xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance"
xsi:schemaLocation="http://www.w3.org/2005/01/pronunciation-lexicon
http://www.w3.org/TR/2007/CR-pronunciation-lexicon-20071212/pls.xsd"
alphabet="ipa" xml:lang="en-US">
<lexeme ...>
<grapheme>...</grapheme>
<phoneme ...>...</phoneme>
</lexeme>
</lexicon>
XML mô tả phần tử gốc lexicon (từ vựng) có thể chứa nhiều phần tử con lexeme (từ vị). Mỗi
phần tử con lexeme có thể chứa nhiều phần tử grapheme và nhiều phần tử phoneme (âm vị). Đặc
tả này cho phép bạn ghi đè lên thuộc tính alphabet (bảng chữ cái) nhưng không cho phép bạn
ghi đè lên thuộc tính ngôn ngữ xml:lang. Để lưu các từ vị cho các ngôn ngữ khác nhau, chắc
chắn bạn cần tách riêng các tệp từ vựng PLS. Bảng chữ cái mặc định trong từ vựng này là ipa,
nói đến hệ thống IPA (International Phonetic Alphabet – Bảng chữ cái phiên âm quốc tế) để biểu
diễn các âm thanh (xem phần Tài nguyên). Biểu diễn IPA về các âm vị là các ký tự Unicode
nhiều byte. Cả hai HTK và Sphinx đều sử dụng các mã ASCII thuần. Nhận xét quan trọng này
được giải quyết ở phần sau trong bài này.
Lợi thế của việc sử dụng đặc tả PLS là ở chỗ nó thêm cấu trúc chặt chẽ hơn và cho phép bạn lưu
trữ thêm thông tin, chẳng hạn như thành phần của tiếng nói và các bảng chữ cái cụ thể. Chi tiết
về thành phần của tiếng nói là quan trọng trong tiếng Anh vì một số từ có thể được viết theo

chính tả giống nhau (các từ cùng chữ) lại được phát âm khác nhau tùy thuộc vào vai trò ngữ pháp
của chúng. Ví dụ, đối với từ perfect, nếu nó là một tính từ thì sẽ phát âm khác với khi nó là một
động từ vì trọng âm được đặt ở một vị trí khác nhau. Thông tin bổ sung được lưu trữ trong các
thuộc tính cho phép bạn trích ra các bản ghi cụ thể từ toàn bộ tệp, tùy theo yêu cầu. Khi sử dụng
phương pháp này, bạn có thể tìm kiếm một bảng chữ cái cụ thể trong số nhiều phần tử phoneme.
Hãy xem từ vựng PLS như là một cơ sở dữ liệu về thông tin từ vựng mà từ đó bạn có thể trích ra
thông tin chi tiết liên quan đến công cụ giọng nói mà bạn sử dụng. Liệt kê 4 là một ví dụ về định
dạng PLS.
Liệt kê 4. Một từ theo định dạng PLS
<?xml version="1.0" encoding="UTF-8"?>
<lexicon version="1.0"
xmlns="http://www.w3.org/2005/01/pronunciation-lexicon"
xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance"
xsi:schemaLocation="http://www.w3.org/2005/01/pronunciation-lexicon
http://www.w3.org/TR/2007/CR-pronunciation-lexicon-20071212/pls.xsd"
alphabet="ipa" xml:lang="en">
<lexeme role="noun">
<grapheme>agency</grapheme>
<phoneme alphabet="x-htk-voxforge">ey jh ih n s iy</phoneme>
<phoneme alphabet="x-cmusphinx">EY JH AH N S IY</phoneme>
</lexeme>
</lexicon>
Ví dụ trong Liệt kê 4 chỉ lưu trữ một từ có hai biểu diễn âm vị có thể. Bạn có thể lọc ra một trong
số các chuỗi phoneme bằng cách sử dụng thuộc tính alphabet. Phần tử lexeme cho thấy thuộc
tính role của noun (danh từ). Trong khi việc này cung cấp nhiều thông tin, thì trong trường hợp
này nó lại quá dư thừa vì từ đó chỉ được sử dụng như một danh từ, không có các kịch bản phát
âm phức tạp nào.
Bằng cách các biểu diễn phoneme từ hai nguồn khác nhau ở cạnh nhau, bạn có thể thấy rõ sự
khác biệt tinh tế. Thông tin này có thể có ích trong việc giải quyết các vấn đề nhận dạng tiếng
nói.
Không phải Sphinx của CMU hay HTK có thể sử dụng trực tiếp một từ vựng PLS, mà phần đầu
của simon (xem phần Tài nguyên) với bộ công cụ HTK mới có thể làm được điều đó. Nếu bạn
đang sử dụng trực tiếp HTK hoặc Sphinx, bạn cần chắc chắn rằng có thể dễ dàng chuyển từ văn
bản thuần sang PLS và ngược lại mà không mất thông tin.
Các phần sau đây cho thấy cách sử dụng Python để chuyển từ một flat-file sang PLS và ngược
lại. Giả sử bạn đã tùy chỉnh thông tin trong một từ vựng flat-file.
Về đầu trang
Chuyển đổi sang PLS

Mã trong Liệt kê 5 sử dụng Python, nhưng bạn có thể thực hiện điều tương tự theo nhiều cách
khác. (hãy xem hướng dẫn trên developerWorks về XSLT (Extensible Stylesheet Language
Transformations - Các chuyển đổi ngôn ngữ bản định kiểu mở rộng) trong phần Tài nguyên).
Một số người muốn sử dụng các thư viện để kiểm tra tính chắc chắn của XML ở mỗi bước nhỏ
để biết thêm thông tin phản hồi trực tiếp chỉ ra nơi có vấn đề, đặc biệt là đối với các tệp nguồn
lớn và có thể chứa các lỗi và các xung đột. Ví dụ dưới đây để lại việc kiểm tra vào bước cuối
cùng, hàm ý một quy ước là các flat-file đều đúng định dạng.
Liệt kê 5. Chuyển đổi sang PLS
from elementtree.ElementTree import parse
import string as str
import sys
import cgi
#
# call with
# python flat2pls.py vox
# or
# python flat2pls.py spx
#
if len(sys.argv) == 2:
src = sys.argv[1]
else:
exit("wrong args")
#
outfile = "mylex"+src+".pls"
print "out is "+outfile
out = open(outfile,"w")
out.write('<?xml version="1.0" encoding="UTF-8"?>\n\
<lexicon version="1.0"\n \
xmlns="http://www.w3.org/2005/01/pronunciation-lexicon"\n\
xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance"\n \
xsi:schemaLocation="http://www.w3.org/2005/01/pronunciation-lexicon\n \
http://www.w3.org/TR/2007/CR-pronunciation-lexicon-
20071212/pls.xsd"\n\
alphabet="ipa" xml:lang="en">')
# now the lexemes
if src == "vox":
f = open("vf.lex","r")
for line in f:
line = str.strip(line)
word = str.split(line,"\t")
#gr = str.strip(word[1],"[]")
gr = cgi.escape(word[0])
out.write('\n\
<lexeme>\n\
<grapheme>'+gr+'</grapheme>\n\
<phoneme alphabet="x-htk-voxforge">'+word[2]+'</phoneme>\n\
</lexeme>')
else: # src is sphinx
f = open("cmu.dic","r")
for line in f:
line = str.strip(line)
word = str.split(line,"\t")

