Series 2 · 第 10 篇——為什麼 Quizzman Fanqie Engine 不是漢越字典 上一篇:準確率與 Benchmark:Quizzman Fanqie Engine 的評估方法
為什麼 Quizzman Fanqie Engine 並不是一部漢越字典?
初次接觸 Quizzman Fanqie Engine 時,許多人都會認為它只是一套漢越音查詢工具。這樣的理解並沒有錯,但並不完整。Engine 確實可以輸出漢越音、Pinyin,以及各種音韻資訊,因此很容易被誤認為電子字典。然而,如果深入觀察整個運作流程,就會發現兩者解決的是完全不同的問題。字典儲存的是結果;Quizzman Fanqie Engine 重建的是結果形成的過程。 這正是 Dictionary Lookup 與 Historical Phonology Inference Engine 之間最根本的差異。
漢越字典是如何工作的?
大多數電子字典,
都採用相同的方式。
使用者輸入:
國
系統查詢資料表:
國
↓
quốc
如果再輸入:
德
系統再次查詢:
德
↓
đức
每一個漢字,
都是一筆獨立資料。
如果要新增新的漢字,
只需要加入新的紀錄即可。
這種架構:
- 容易開發;
- 容易理解;
- 查詢速度極快;
- 非常適合日常檢索。
對一般使用而言,
這樣的方法完全足夠。
查表方法的限制
但這種架構,
存在一個根本性的限制。
字典知道:
國
↓
quốc
卻不知道:
- 為什麼讀作 quốc?
- 為什麼不是 cuốc?
- 為什麼是去聲(sắc)?
- 為什麼保留 -c 韻尾?
- 為什麼聲母變成 qu-?
換句話說,
字典只保存:
結果(Result)
卻沒有保存:
形成結果的過程(Reasoning)。
如果遇到字典裡沒有的漢字呢?
這是一個最簡單的測試。
如果某個漢字不存在於資料庫,
一般字典只能回答:
查無資料。
或者:
沒有收錄。
這是很正常的。
因為字典不知道:
讀音是如何形成的。
它只能回答:
自己已經記錄過的內容。
Fanqie Engine 的思考方式完全不同
對 Quizzman Fanqie Engine 而言,
真正的問題不是:
這個字怎麼讀?
而是:
這個讀音是如何形成的?
兩個問題看起來相似,
本質卻完全不同。
如果 Engine 已知:
- 反切;
- 聲母;
- 韻部;
- 攝;
- 等;
- 開合口;
- 平上去入;
- 漢越音的歷史演變;
那麼,
即使從未遇過這個漢字,
它仍然可以推導出合理的漢越音。
這就是最大的差異。
Engine 並不是從漢字開始
字典的流程:
漢字
↓
讀音
Quizzman Fanqie Engine 的流程則是:
漢字
↓
反切
↓
Middle Chinese
↓
音韻規則
↓
漢越音
換句話說,
Engine 保存的,
不是數萬筆讀音。
而是:
產生這些讀音的規則。
規則比資料更有價值
假設有一千個漢字,
都屬於相同的音韻類型。
字典需要保存:
1000
筆資料。
Quizzman Fanqie Engine
只需要:
1
條規則。
例如:
通攝
↓
Rule A
梗攝
↓
Rule B
流攝
↓
Rule C
每一條規則,
都可以同時適用於數百、
甚至數千個漢字。
這就是 Rule Engine 的思維。
並不是 AI 在「猜」
今天,
許多人看到能夠推導結果的系統,
第一個反應就是:
AI。
Quizzman Fanqie Engine
並不是如此。
它不是:
猜測。
也不是:
統計預測。
每一步,
都依據具體的音韻規則。
例如:
聲母
↓
決定起始輔音
攝
↓
決定韻尾
等
↓
影響元音
清濁聲母
↓
影響聲調
每一步都可以說明。
沒有任何一步,
來自模型的「直覺」。
Explainable by Design
Quizzman Fanqie Engine
最重要的設計目標之一,
就是:
Every Result Must Be Explainable.
例如,
Engine 不只是輸出:
國
↓
quốc
還可以進一步說明:
- 使用了哪一個反切;
- 選用了哪一組聲母;
- 韻屬於哪一攝;
- 為什麼出現介音 u;
- 為什麼保留 -c 韻尾;
- 為什麼屬於去聲;
- 為什麼這個候選結果優先於其他候選。
這正是大多數電子字典無法做到的。
字典與 Engine 並不是互相排斥
有趣的是,
Quizzman Fanqie Engine
依然使用字典。
只是,
字典的位置改變了。
傳統架構:
Dictionary
↓
Answer
Quizzman Fanqie Engine:
Rule Engine
↓
Pure Projection
↓
Dictionary
↓
Lexical Normalization
↓
Final Result
字典不再主導整個推導流程。
它只是最後的:
Lexical Layer。
這也是整個架構最大的改變之一。
如果規則與字典不同呢?
這是一個非常重要的問題。
假設:
Pure Projection
得到:
A
但現代漢越字典記錄:
B
一般字典,
直接回傳:
B。
Quizzman Fanqie Engine
則會先判斷:
- 是規則錯誤?
- 還是古讀?
- 還是歷史例外?
- 還是文讀?
- 還是字典資料尚未完整?
只有完成分析之後,
Engine 才會決定最終輸出。
因此,
它不會把所有差異,
都視為錯誤。
為什麼這件事重要?
如果目的只是:
查詢幾萬個漢字。
那麼,
一本字典已經足夠。
但如果希望:
- 研究漢越音歷史;
- 從反切重建讀音;
- 由 Middle Chinese 推導 Pinyin;
- 分析韻書;
- 驗證音韻規則;
- 建立語言學工具;
光有資料,
是不夠的。
真正需要的是:
一套能夠推理的系統。
一個平台,而不是一個應用程式
因此,
Quizzman Fanqie Engine
從來不是以查詢工具為目標。
它是一套:
Historical Phonology Platform。
從同一份 Middle Chinese Profile,
Engine 可以產生:
- 漢越音;
- Pinyin;
- 歷史讀音;
- NLP 所需資料;
- 反切研究工具;
- 更多未來的 Projection。
只有把規則放在整個架構中心,
這些能力才可能實現。
從 Lookup 到 Inference
Quizzman Fanqie Engine
與傳統漢越字典,
最大的不同,
其實可以用兩個字概括。
Dictionary
↓
Lookup
Fanqie Engine
↓
Inference
前者:
保存答案。
後者:
重建答案形成的過程。
前者知道:
讀音是什麼。
後者知道:
為什麼會這樣讀。
這也是 Quizzman Fanqie Engine 自第一版開始就始終堅持的理念:
不是建立一個更大的資料庫,而是建立一套真正理解並模型化一千多年來漢越音形成規律的 Historical Phonology Rule Engine。