Quizzman Fanqie Engine 的準確率:如何評估一套歷史音韻引擎?

Quizzman Fanqie Engine 系列(第九篇)

上一篇:Lexical Normalization

Quizzman Fanqie Engine 的準確率:如何評估一套歷史音韻引擎?

許多人第一次接觸 Quizzman Fanqie Engine 時,最常提出的問題就是:這套 Engine 的準確率是多少? 這是一個合理的問題,但並不容易回答。與 OCR、機器翻譯或影像辨識不同,歷史音韻引擎並非只產生唯一答案。它必須同時重建歷史音韻規律、處理不同讀音層次,並區分音韻規律與詞彙例外。因此,評估 Fanqie Engine 並不是單純計算「答對幾個字」,而是需要一套多層次的測試與評估方法。

為什麼不能只說「準確率 95%」?

評估電子字典時,

通常非常直接。

例如:

國
 │
 ▼
quốc

如果系統輸出 quốc

即可判定正確。

若輸出 quấc

則視為錯誤。

然而,

對歷史音韻引擎而言,

問題並沒有這麼單純。

同一個漢字,

可能同時存在:

  • 多種反切。
  • 多種歷史讀音。
  • 多個漢越音層次。
  • 不同文獻來源。

因此,

即使 Engine 的結果與現代字典不同,

也未必代表它錯了。

有可能:

  • 音韻推導完全正確。
  • 只是現代詞彙層已經改變。

因此,

Quizzman Fanqie Engine 並不以單一百分比作為評價標準。

兩個完全不同的目標

Quizzman Fanqie Engine 同時追求兩項彼此獨立的目標。

第一個目標

音韻規律是否正確?

這就是 Pure Projection

在這一層,

Engine 僅依據:

  • 反切。
  • 中古漢語。
  • 音韻規律。

完全不使用任何字典資料

第二個目標

最終讀音是否符合今日通行的漢越音?

這就是 Hybrid

除了音韻規律,

Engine 還會參考:

  • 漢越音資料。
  • 歷史讀音層。
  • Thiều Chửu 字典。
  • Candidate Ranking。

兩者評估的是不同問題。

一個結果,

可能在音韻推導上完全正確,

卻因詞彙演變而與今日常見讀音不同。

Pure Projection 評估什麼?

Pure Projection 只回答一個問題:

如果完全依照漢越音的歷史音韻規律推導,結果應該是什麼?

因此,

它不考慮:

  • 現代越南人如何發音。
  • 字典如何記載。
  • 哪一種讀法最普遍。

唯一評估的是:

音韻推導是否正確。

這也是整個系統最困難的部分,

因為所有責任都來自演算法本身。

Hybrid 評估什麼?

Hybrid 解決的是另一個問題。

當 Pure Projection 得出音韻結果後,

Engine 會進一步與歷史漢越音資料進行比對。

若同時存在多個候選讀音,

系統便綜合評估:

  • 反切來源。
  • 是否符合音韻規律。
  • 歷史讀音層。
  • 字典資料。
  • 各候選結果的可信度。

最後產生最適合的讀音。

這也是 Quizzman Fanqie Engine 提供給一般使用者的預設模式。

Benchmark 如何建立?

為了客觀評估 Engine,

Quizzman Fanqie Engine 並非依賴單一測試集,

而是建立多組不同用途的 Benchmark。

包括:

  • Golden Fixture
  • Random Corpus
  • Thiều Chửu Benchmark
  • Batch Regression
  • Audit Corpus
  • Stress Test

每一組資料,

都用來回答不同的問題。

Golden Fixture

Golden Fixture 是整個測試系統中最重要的一組資料。

其中所有漢字,

皆經過人工逐一驗證。

涵蓋內容包括:

  • 平聲。
  • 上聲。
  • 去聲。
  • 入聲。
  • 清聲母。
  • 濁聲母。
  • 各種歷史特殊案例。

Golden Fixture 的目的,

並不是提高 Benchmark 分數。

它最大的用途是:

偵測 Regression(回歸錯誤)。

只要某次修改破壞了原本正確的音韻規律,

Golden Fixture 就能立即發現。

Random Corpus

Golden Fixture 通常規模較小。

因此,

還需要更大的測試資料。

Random Corpus 是由漢越音資料庫隨機抽樣建立。

例如:

  • Random 300
  • Random 300B

主要用來評估整個 Pipeline 在接近真實情境下的表現。

目前內部測試中,

Hybrid 在此資料集上的一致率約為:

89%

值得注意的是,

Pure Projection 的一致率則低於 Hybrid。

這並不是音韻演算法較差,

反而說明今日漢越音已經歷了大量詞彙化(Lexicalization)的演變。

Thiều Chửu Benchmark

另一項重要測試,

是與 Thiều Chửu 漢越字典進行比對。

Thiều Chửu 是越南影響最深遠的漢越字典之一。

在約一千個漢字的內部測試中,

Hybrid 與主要讀音的符合率約為:

94.5%

這代表:

Lexical Normalization 能有效選擇符合現代漢越音使用習慣的讀法。

不過,

此 Benchmark 並不是要證明 Thiều Chửu 就是唯一標準,

而是評估 Engine 與主流資料來源之間的相容程度。

數千漢字的 Audit

除了小型 Benchmark,

Quizzman Fanqie Engine 也會在數千個漢字上進行 Audit。

不同於單純的「正確/錯誤」,

系統會將每一筆結果分類,例如:

  • 完全正確。
  • 詞彙層差異。
  • 多音字。
  • 拼寫差異。
  • 歷史例外。
  • 真正的音韻規律錯誤。

如此一來,

開發者便能明確知道問題究竟出在哪一層。

若所有案例都只標記為「錯誤」,

將很難有系統地改善 Engine。

最重要的指標:True Rule Error

在 Quizzman Fanqie Engine 的開發過程中,

團隊並不把所有差異都視為錯誤。

真正關注的是:

True Rule Error

也就是:

  • 音韻規律套用錯誤。
  • 中古漢語重建錯誤。
  • Projection 推導錯誤。
  • 無法用歷史音韻解釋的結果。

這些,

才是真正需要修正的問題。

至於:

  • 不同讀音層。
  • 多音字。
  • 文讀。
  • 白讀。

通常會交由 Lexical Normalization 處理,

而不是修改音韻演算法。

Regression Test

開發歷史音韻 Engine 最大的風險之一,

就是:

修正一條規律,

卻意外破壞數百條原本正確的規律。

因此,

每次重大更新後,

所有 Benchmark 都會重新執行。

若發現:

  • Hybrid 準確率下降。
  • True Rule Error 增加。
  • Golden Fixture 出現新的錯誤。

該次修改便會重新檢討。

透過這樣的流程,

Quizzman Fanqie Engine 能持續新增功能,

同時維持整體規律的穩定性。

準確率不只是單一數字

可以看出,

評估 Quizzman Fanqie Engine,

與評估一般查詢工具有很大的不同。

與其問:

「Engine 的準確率是多少?」

更重要的是回答:

  • 音韻規律是否正確?
  • 中古漢語是否重建正確?
  • 是否符合歷史漢越音?
  • 是否把例外誤當成規律?
  • 是否破壞了既有規律?

正因為採用多層次評估,

Engine 才能長期穩定演進,

而不是依賴大量特例來修補結果。

比 Benchmark 更重要的事

高 Benchmark 分數固然重要,

但對歷史音韻研究而言,

可解釋性(Explainability)更加重要。

Quizzman Fanqie Engine 的每一個結果,

都可以追溯到:

  • 使用的反切。
  • 中古漢語音韻資料。
  • 音韻推導規則。
  • 詞彙層調整。
  • 每一步推導的可信度。

因此,

使用者不只知道 Engine 如何讀

更能理解:

為什麼會得到這樣的讀音。

這也是 Quizzman Fanqie Engine 一直秉持的設計理念:

不只是提供答案,

而是建立一套可解釋、可驗證、可追溯的歷史音韻推論系統。

下一篇

下一篇將回到一個看似簡單,

卻最能體現 Quizzman Fanqie Engine 設計理念的問題:

為什麼 Quizzman Fanqie Engine 不是一本漢越字典?

我們將進一步探討:

Dictionary LookupHistorical Phonology Inference Engine 的本質差異,以及 Quizzman 為何選擇以歷史音韻規律建模,而不是單純儲存數萬筆靜態讀音資料。