Quizzman Fanqie Engine 系列(第九篇)
上一篇:Lexical Normalization
Quizzman Fanqie Engine 的準確率:如何評估一套歷史音韻引擎?
許多人第一次接觸 Quizzman Fanqie Engine 時,最常提出的問題就是:這套 Engine 的準確率是多少? 這是一個合理的問題,但並不容易回答。與 OCR、機器翻譯或影像辨識不同,歷史音韻引擎並非只產生唯一答案。它必須同時重建歷史音韻規律、處理不同讀音層次,並區分音韻規律與詞彙例外。因此,評估 Fanqie Engine 並不是單純計算「答對幾個字」,而是需要一套多層次的測試與評估方法。
為什麼不能只說「準確率 95%」?
評估電子字典時,
通常非常直接。
例如:
國
│
▼
quốc
如果系統輸出 quốc,
即可判定正確。
若輸出 quấc,
則視為錯誤。
然而,
對歷史音韻引擎而言,
問題並沒有這麼單純。
同一個漢字,
可能同時存在:
- 多種反切。
- 多種歷史讀音。
- 多個漢越音層次。
- 不同文獻來源。
因此,
即使 Engine 的結果與現代字典不同,
也未必代表它錯了。
有可能:
- 音韻推導完全正確。
- 只是現代詞彙層已經改變。
因此,
Quizzman Fanqie Engine 並不以單一百分比作為評價標準。
兩個完全不同的目標
Quizzman Fanqie Engine 同時追求兩項彼此獨立的目標。
第一個目標
音韻規律是否正確?
這就是 Pure Projection。
在這一層,
Engine 僅依據:
- 反切。
- 中古漢語。
- 音韻規律。
完全不使用任何字典資料。
第二個目標
最終讀音是否符合今日通行的漢越音?
這就是 Hybrid。
除了音韻規律,
Engine 還會參考:
- 漢越音資料。
- 歷史讀音層。
- Thiều Chửu 字典。
- Candidate Ranking。
兩者評估的是不同問題。
一個結果,
可能在音韻推導上完全正確,
卻因詞彙演變而與今日常見讀音不同。
Pure Projection 評估什麼?
Pure Projection 只回答一個問題:
如果完全依照漢越音的歷史音韻規律推導,結果應該是什麼?
因此,
它不考慮:
- 現代越南人如何發音。
- 字典如何記載。
- 哪一種讀法最普遍。
唯一評估的是:
音韻推導是否正確。
這也是整個系統最困難的部分,
因為所有責任都來自演算法本身。
Hybrid 評估什麼?
Hybrid 解決的是另一個問題。
當 Pure Projection 得出音韻結果後,
Engine 會進一步與歷史漢越音資料進行比對。
若同時存在多個候選讀音,
系統便綜合評估:
- 反切來源。
- 是否符合音韻規律。
- 歷史讀音層。
- 字典資料。
- 各候選結果的可信度。
最後產生最適合的讀音。
這也是 Quizzman Fanqie Engine 提供給一般使用者的預設模式。
Benchmark 如何建立?
為了客觀評估 Engine,
Quizzman Fanqie Engine 並非依賴單一測試集,
而是建立多組不同用途的 Benchmark。
包括:
- Golden Fixture
- Random Corpus
- Thiều Chửu Benchmark
- Batch Regression
- Audit Corpus
- Stress Test
每一組資料,
都用來回答不同的問題。
Golden Fixture
Golden Fixture 是整個測試系統中最重要的一組資料。
其中所有漢字,
皆經過人工逐一驗證。
涵蓋內容包括:
- 平聲。
- 上聲。
- 去聲。
- 入聲。
- 清聲母。
- 濁聲母。
- 各種歷史特殊案例。
Golden Fixture 的目的,
並不是提高 Benchmark 分數。
它最大的用途是:
偵測 Regression(回歸錯誤)。
只要某次修改破壞了原本正確的音韻規律,
Golden Fixture 就能立即發現。
Random Corpus
Golden Fixture 通常規模較小。
因此,
還需要更大的測試資料。
Random Corpus 是由漢越音資料庫隨機抽樣建立。
例如:
- Random 300
- Random 300B
主要用來評估整個 Pipeline 在接近真實情境下的表現。
目前內部測試中,
Hybrid 在此資料集上的一致率約為:
89%
值得注意的是,
Pure Projection 的一致率則低於 Hybrid。
這並不是音韻演算法較差,
反而說明今日漢越音已經歷了大量詞彙化(Lexicalization)的演變。
Thiều Chửu Benchmark
另一項重要測試,
是與 Thiều Chửu 漢越字典進行比對。
Thiều Chửu 是越南影響最深遠的漢越字典之一。
在約一千個漢字的內部測試中,
Hybrid 與主要讀音的符合率約為:
94.5%
這代表:
Lexical Normalization 能有效選擇符合現代漢越音使用習慣的讀法。
不過,
此 Benchmark 並不是要證明 Thiều Chửu 就是唯一標準,
而是評估 Engine 與主流資料來源之間的相容程度。
數千漢字的 Audit
除了小型 Benchmark,
Quizzman Fanqie Engine 也會在數千個漢字上進行 Audit。
不同於單純的「正確/錯誤」,
系統會將每一筆結果分類,例如:
- 完全正確。
- 詞彙層差異。
- 多音字。
- 拼寫差異。
- 歷史例外。
- 真正的音韻規律錯誤。
如此一來,
開發者便能明確知道問題究竟出在哪一層。
若所有案例都只標記為「錯誤」,
將很難有系統地改善 Engine。
最重要的指標:True Rule Error
在 Quizzman Fanqie Engine 的開發過程中,
團隊並不把所有差異都視為錯誤。
真正關注的是:
True Rule Error
也就是:
- 音韻規律套用錯誤。
- 中古漢語重建錯誤。
- Projection 推導錯誤。
- 無法用歷史音韻解釋的結果。
這些,
才是真正需要修正的問題。
至於:
- 不同讀音層。
- 多音字。
- 文讀。
- 白讀。
通常會交由 Lexical Normalization 處理,
而不是修改音韻演算法。
Regression Test
開發歷史音韻 Engine 最大的風險之一,
就是:
修正一條規律,
卻意外破壞數百條原本正確的規律。
因此,
每次重大更新後,
所有 Benchmark 都會重新執行。
若發現:
- Hybrid 準確率下降。
- True Rule Error 增加。
- Golden Fixture 出現新的錯誤。
該次修改便會重新檢討。
透過這樣的流程,
Quizzman Fanqie Engine 能持續新增功能,
同時維持整體規律的穩定性。
準確率不只是單一數字
可以看出,
評估 Quizzman Fanqie Engine,
與評估一般查詢工具有很大的不同。
與其問:
「Engine 的準確率是多少?」
更重要的是回答:
- 音韻規律是否正確?
- 中古漢語是否重建正確?
- 是否符合歷史漢越音?
- 是否把例外誤當成規律?
- 是否破壞了既有規律?
正因為採用多層次評估,
Engine 才能長期穩定演進,
而不是依賴大量特例來修補結果。
比 Benchmark 更重要的事
高 Benchmark 分數固然重要,
但對歷史音韻研究而言,
可解釋性(Explainability)更加重要。
Quizzman Fanqie Engine 的每一個結果,
都可以追溯到:
- 使用的反切。
- 中古漢語音韻資料。
- 音韻推導規則。
- 詞彙層調整。
- 每一步推導的可信度。
因此,
使用者不只知道 Engine 如何讀,
更能理解:
為什麼會得到這樣的讀音。
這也是 Quizzman Fanqie Engine 一直秉持的設計理念:
不只是提供答案,
而是建立一套可解釋、可驗證、可追溯的歷史音韻推論系統。
下一篇
下一篇將回到一個看似簡單,
卻最能體現 Quizzman Fanqie Engine 設計理念的問題:
為什麼 Quizzman Fanqie Engine 不是一本漢越字典?
我們將進一步探討:
Dictionary Lookup 與 Historical Phonology Inference Engine 的本質差異,以及 Quizzman 為何選擇以歷史音韻規律建模,而不是單純儲存數萬筆靜態讀音資料。