為什麼 Quizzman 不使用 AI 自動學習音韻規律?

Series 2 · 第 11 篇——不用 AI 自動學習規律 上一篇:為什麼 Parser 康熙字典比 HTML Parser 更困難?

為什麼 Quizzman 不使用 AI 自動學習音韻規律?

在人工智慧迅速發展的今天,許多人認為只要提供足夠龐大的資料,AI 就能自動學會所有語言規律。這種方法確實適用於影像辨識、機器翻譯或自然語言生成等領域。然而,歷史音韻學(Historical Phonology) 面對的是另一種類型的問題。Quizzman Fanqie Engine 並不依賴 AI 自行發現或生成漢越音規律,而是建立在已經經過研究、驗證與模型化的學術成果之上。這並不是 AI 能力不足,而是一項刻意的設計選擇,目的是確保整個系統具備透明性、可解釋性與可驗證性

AI 很強,但不是所有問題都屬於同一種類

人工智慧已經在許多領域取得巨大成功。

例如:

  • 語音辨識;
  • 手寫文字辨識;
  • 機器翻譯;
  • 語意搜尋;
  • 文字生成;
  • 影像分類。

這些問題都有共同特徵:

大量資料

機率學習

預測結果

這正是現代 AI 最擅長的工作。


但歷史音韻學屬於另一種問題

假設我們擁有數千個漢字及其漢越音。

AI 當然可以學到:

đức

quốc

học

然而,

音韻學真正關心的問題卻是:

為什麼這些字會這樣讀?

這已經不是:

預測(Prediction)。

而是:

解釋(Explanation)。


預測與解釋是兩件不同的事情

假設 AI 推測:

某字

quốc

接下來,

研究者一定會問:

為什麼?

如果 AI 只能回答:

因為訓練資料大多如此。

對歷史語言學而言,

這樣的答案並不足夠。

研究者真正需要知道的是:

  • 哪個聲母決定了起始輔音?
  • 哪個韻部形成了主要元音?
  • 為什麼保留 -c 韻尾?
  • 為什麼屬於去聲?
  • 套用了哪一條音韻規則?

因此,

研究工作不只是要求:

結果正確。

更要求:

理由清楚。


Rule Engine 擁有完整的推理路徑

Quizzman Fanqie Engine

最重要的特點之一,

就是:

每一個結果,

都可以完整回溯。

例如:

德紅切

聲母

韻部

Middle Chinese

音韻規則

quốc

研究者可以逐步檢查:

每一個推導步驟。

如果其中某一步出錯,

只需要修正那一步即可。

這正是科學研究所需要的能力。


AI 很難直接指出具體規律

假設 AI 學到了:

通攝

-c

那麼,

它是否還能回答:

  • 這條規律覆蓋了多少比例的資料?
  • 哪些屬於例外?
  • 例外形成的歷史原因是什麼?
  • 如果更換聲母,規律是否仍成立?
  • 是否受到「等」或「開合口」影響?

通常而言,

大型模型很難完整回答這些問題。

而 Rule Engine

正是建立在這些問題之上的。


每一條規律都必須有證據

在 Quizzman Fanqie Engine 中,

沒有任何規律,

只是因為:

「看起來合理」

就被加入系統。

每一條規律,

都必須經過:

資料調查

統計分析

學術比對

模型化

Audit

Regression Test

也就是說,

每一條規律,

都有可以追溯的證據。

這是歷史音韻學極為重要的原則。


AI 很難區分規律與例外

假設資料如下:

95%

-c

5%

-ch

AI 可以同時學會兩種模式。

但 AI 很難自行判斷:

  • 這 5% 是例外?
  • 還是另一條規律?
  • 還是資料錯誤?
  • 還是古層漢越音?

這些判斷,

屬於學術研究的範疇。

不能僅依靠統計機率。


Quizzman 並不是反對 AI

有些人誤以為:

不用 AI,

就等於否定 AI。

事實並非如此。

Quizzman 在許多地方,

都大量使用 AI。

例如:

  • 漢字 OCR;
  • 語意搜尋;
  • 資料分類;
  • 輔助分析;
  • 文件撰寫;
  • 協助發現可疑資料,供研究者進一步檢查。

換句話說,

AI 是:

Research Assistant。

而不是:

Rule Maker。


規律仍由研究者建立

在 Quizzman Fanqie Engine 中,

所有規律,

皆來自於:

  • 《廣韻》;
  • 《集韻》;
  • 《康熙字典》;
  • Nguyễn Tài Cẩn;
  • 王力;
  • Baxter–Sagart;
  • 以及其他 Middle Chinese 研究成果。

完成學術驗證之後,

這些規律,

才會被轉化成演算法。

電腦負責:

高速、

一致、

大規模地執行規則。

但規律本身,

仍來自歷史語言學研究。


AI 與 Rule Engine 可以互相補充

實際上,

AI 與 Rule Engine

並不是對立關係。

兩者可以形成非常有效的合作。

例如,

AI 可以協助:

  • 發現異常案例;
  • 聚類具有共同特徵的資料;
  • 提示潛在 Pattern;
  • 協助大規模資料審查。

之後,

研究者再負責:

  • 驗證;
  • 對照文獻;
  • 分析原因;
  • 判斷是否形成新的音韻規律。

這正是 Quizzman

看待 AI 的方式。


真正重要的不是 AI 或 Rule Engine

真正重要的,

從來不是:

採用了哪一種技術。

而是:

是否可以驗證。

當系統輸出一個結果時,

研究者必須能回答:

  • 使用了哪一條規律?
  • 學術依據來自哪裡?
  • 是否能完整重現推理流程?
  • 當新的資料出現時,是否可以重新評估?

這些都是科學研究最基本的要求。


Quizzman 選擇可解釋,而不是黑盒子

Quizzman Fanqie Engine

並不是為了與 AI 競爭而誕生。

相反,

整個專案在資料處理、

研究輔助等許多環節,

都積極利用 AI。

然而,

對於最核心的:

音韻規律建模(Historical Phonology Modeling)

Quizzman 選擇另一條道路:

建立一套可以閱讀、

可以驗證、

可以解釋的 Rule Engine。

在歷史語言學中,

真正有價值的,

不是單純得到正確答案。

而是能夠回答:

「為什麼它是正確的?」

因此,

Quizzman 並沒有讓 AI 自動從資料中生成一套無法解釋的黑盒模型。

AI 扮演的是:

研究助理。

真正完成推理的,

仍然是建立於學術研究之上的音韻規則,

以及將這些規則實作為演算法的 Historical Phonology Rule Engine。

正因如此,

Quizzman Fanqie Engine 才能同時兼具:

  • 科學性;
  • 可追溯性;
  • 可驗證性;
  • 可解釋性。