Series 2 · 第 11 篇——不用 AI 自動學習規律 上一篇:為什麼 Parser 康熙字典比 HTML Parser 更困難?
為什麼 Quizzman 不使用 AI 自動學習音韻規律?
在人工智慧迅速發展的今天,許多人認為只要提供足夠龐大的資料,AI 就能自動學會所有語言規律。這種方法確實適用於影像辨識、機器翻譯或自然語言生成等領域。然而,歷史音韻學(Historical Phonology) 面對的是另一種類型的問題。Quizzman Fanqie Engine 並不依賴 AI 自行發現或生成漢越音規律,而是建立在已經經過研究、驗證與模型化的學術成果之上。這並不是 AI 能力不足,而是一項刻意的設計選擇,目的是確保整個系統具備透明性、可解釋性與可驗證性。
AI 很強,但不是所有問題都屬於同一種類
人工智慧已經在許多領域取得巨大成功。
例如:
- 語音辨識;
- 手寫文字辨識;
- 機器翻譯;
- 語意搜尋;
- 文字生成;
- 影像分類。
這些問題都有共同特徵:
大量資料
↓
機率學習
↓
預測結果
這正是現代 AI 最擅長的工作。
但歷史音韻學屬於另一種問題
假設我們擁有數千個漢字及其漢越音。
AI 當然可以學到:
德
↓
đức
國
↓
quốc
學
↓
học
然而,
音韻學真正關心的問題卻是:
為什麼這些字會這樣讀?
這已經不是:
預測(Prediction)。
而是:
解釋(Explanation)。
預測與解釋是兩件不同的事情
假設 AI 推測:
某字
↓
quốc
接下來,
研究者一定會問:
為什麼?
如果 AI 只能回答:
因為訓練資料大多如此。
對歷史語言學而言,
這樣的答案並不足夠。
研究者真正需要知道的是:
- 哪個聲母決定了起始輔音?
- 哪個韻部形成了主要元音?
- 為什麼保留 -c 韻尾?
- 為什麼屬於去聲?
- 套用了哪一條音韻規則?
因此,
研究工作不只是要求:
結果正確。
更要求:
理由清楚。
Rule Engine 擁有完整的推理路徑
Quizzman Fanqie Engine
最重要的特點之一,
就是:
每一個結果,
都可以完整回溯。
例如:
國
↓
德紅切
↓
聲母
↓
韻部
↓
攝
↓
Middle Chinese
↓
音韻規則
↓
quốc
研究者可以逐步檢查:
每一個推導步驟。
如果其中某一步出錯,
只需要修正那一步即可。
這正是科學研究所需要的能力。
AI 很難直接指出具體規律
假設 AI 學到了:
通攝
↓
-c
那麼,
它是否還能回答:
- 這條規律覆蓋了多少比例的資料?
- 哪些屬於例外?
- 例外形成的歷史原因是什麼?
- 如果更換聲母,規律是否仍成立?
- 是否受到「等」或「開合口」影響?
通常而言,
大型模型很難完整回答這些問題。
而 Rule Engine
正是建立在這些問題之上的。
每一條規律都必須有證據
在 Quizzman Fanqie Engine 中,
沒有任何規律,
只是因為:
「看起來合理」
就被加入系統。
每一條規律,
都必須經過:
資料調查
↓
統計分析
↓
學術比對
↓
模型化
↓
Audit
↓
Regression Test
也就是說,
每一條規律,
都有可以追溯的證據。
這是歷史音韻學極為重要的原則。
AI 很難區分規律與例外
假設資料如下:
95%
↓
-c
5%
↓
-ch
AI 可以同時學會兩種模式。
但 AI 很難自行判斷:
- 這 5% 是例外?
- 還是另一條規律?
- 還是資料錯誤?
- 還是古層漢越音?
這些判斷,
屬於學術研究的範疇。
不能僅依靠統計機率。
Quizzman 並不是反對 AI
有些人誤以為:
不用 AI,
就等於否定 AI。
事實並非如此。
Quizzman 在許多地方,
都大量使用 AI。
例如:
- 漢字 OCR;
- 語意搜尋;
- 資料分類;
- 輔助分析;
- 文件撰寫;
- 協助發現可疑資料,供研究者進一步檢查。
換句話說,
AI 是:
Research Assistant。
而不是:
Rule Maker。
規律仍由研究者建立
在 Quizzman Fanqie Engine 中,
所有規律,
皆來自於:
- 《廣韻》;
- 《集韻》;
- 《康熙字典》;
- Nguyễn Tài Cẩn;
- 王力;
- Baxter–Sagart;
- 以及其他 Middle Chinese 研究成果。
完成學術驗證之後,
這些規律,
才會被轉化成演算法。
電腦負責:
高速、
一致、
大規模地執行規則。
但規律本身,
仍來自歷史語言學研究。
AI 與 Rule Engine 可以互相補充
實際上,
AI 與 Rule Engine
並不是對立關係。
兩者可以形成非常有效的合作。
例如,
AI 可以協助:
- 發現異常案例;
- 聚類具有共同特徵的資料;
- 提示潛在 Pattern;
- 協助大規模資料審查。
之後,
研究者再負責:
- 驗證;
- 對照文獻;
- 分析原因;
- 判斷是否形成新的音韻規律。
這正是 Quizzman
看待 AI 的方式。
真正重要的不是 AI 或 Rule Engine
真正重要的,
從來不是:
採用了哪一種技術。
而是:
是否可以驗證。
當系統輸出一個結果時,
研究者必須能回答:
- 使用了哪一條規律?
- 學術依據來自哪裡?
- 是否能完整重現推理流程?
- 當新的資料出現時,是否可以重新評估?
這些都是科學研究最基本的要求。
Quizzman 選擇可解釋,而不是黑盒子
Quizzman Fanqie Engine
並不是為了與 AI 競爭而誕生。
相反,
整個專案在資料處理、
研究輔助等許多環節,
都積極利用 AI。
然而,
對於最核心的:
音韻規律建模(Historical Phonology Modeling)
Quizzman 選擇另一條道路:
建立一套可以閱讀、
可以驗證、
可以解釋的 Rule Engine。
在歷史語言學中,
真正有價值的,
不是單純得到正確答案。
而是能夠回答:
「為什麼它是正確的?」
因此,
Quizzman 並沒有讓 AI 自動從資料中生成一套無法解釋的黑盒模型。
AI 扮演的是:
研究助理。
真正完成推理的,
仍然是建立於學術研究之上的音韻規則,
以及將這些規則實作為演算法的 Historical Phonology Rule Engine。
正因如此,
Quizzman Fanqie Engine 才能同時兼具:
- 科學性;
- 可追溯性;
- 可驗證性;
- 可解釋性。