為什麼 Quizzman Fanqie Engine 並不是一部漢越字典?

Series 2 · 第 10 篇——為什麼 Quizzman Fanqie Engine 不是漢越字典 上一篇:準確率與 Benchmark:Quizzman Fanqie Engine 的評估方法

為什麼 Quizzman Fanqie Engine 並不是一部漢越字典?

初次接觸 Quizzman Fanqie Engine 時,許多人都會認為它只是一套漢越音查詢工具。這樣的理解並沒有錯,但並不完整。Engine 確實可以輸出漢越音、Pinyin,以及各種音韻資訊,因此很容易被誤認為電子字典。然而,如果深入觀察整個運作流程,就會發現兩者解決的是完全不同的問題。字典儲存的是結果;Quizzman Fanqie Engine 重建的是結果形成的過程。 這正是 Dictionary LookupHistorical Phonology Inference Engine 之間最根本的差異。

漢越字典是如何工作的?

大多數電子字典,

都採用相同的方式。

使用者輸入:

系統查詢資料表:

quốc

如果再輸入:

系統再次查詢:

đức

每一個漢字,

都是一筆獨立資料。

如果要新增新的漢字,

只需要加入新的紀錄即可。

這種架構:

  • 容易開發;
  • 容易理解;
  • 查詢速度極快;
  • 非常適合日常檢索。

對一般使用而言,

這樣的方法完全足夠。


查表方法的限制

但這種架構,

存在一個根本性的限制。

字典知道:

quốc

卻不知道:

  • 為什麼讀作 quốc
  • 為什麼不是 cuốc
  • 為什麼是去聲(sắc)?
  • 為什麼保留 -c 韻尾?
  • 為什麼聲母變成 qu-

換句話說,

字典只保存:

結果(Result)

卻沒有保存:

形成結果的過程(Reasoning)


如果遇到字典裡沒有的漢字呢?

這是一個最簡單的測試。

如果某個漢字不存在於資料庫,

一般字典只能回答:

查無資料。

或者:

沒有收錄。

這是很正常的。

因為字典不知道:

讀音是如何形成的。

它只能回答:

自己已經記錄過的內容。


Fanqie Engine 的思考方式完全不同

對 Quizzman Fanqie Engine 而言,

真正的問題不是:

這個字怎麼讀?

而是:

這個讀音是如何形成的?

兩個問題看起來相似,

本質卻完全不同。

如果 Engine 已知:

  • 反切;
  • 聲母;
  • 韻部;
  • 攝;
  • 等;
  • 開合口;
  • 平上去入;
  • 漢越音的歷史演變;

那麼,

即使從未遇過這個漢字,

它仍然可以推導出合理的漢越音。

這就是最大的差異。


Engine 並不是從漢字開始

字典的流程:

漢字

讀音

Quizzman Fanqie Engine 的流程則是:

漢字

反切

Middle Chinese

音韻規則

漢越音

換句話說,

Engine 保存的,

不是數萬筆讀音。

而是:

產生這些讀音的規則。


規則比資料更有價值

假設有一千個漢字,

都屬於相同的音韻類型。

字典需要保存:

1000

筆資料。

Quizzman Fanqie Engine

只需要:

1

條規則。

例如:

通攝

Rule A

梗攝

Rule B

流攝

Rule C

每一條規則,

都可以同時適用於數百、

甚至數千個漢字。

這就是 Rule Engine 的思維。


並不是 AI 在「猜」

今天,

許多人看到能夠推導結果的系統,

第一個反應就是:

AI。

Quizzman Fanqie Engine

並不是如此。

它不是:

猜測。

也不是:

統計預測。

每一步,

都依據具體的音韻規則。

例如:

聲母

決定起始輔音

決定韻尾

影響元音

清濁聲母

影響聲調

每一步都可以說明。

沒有任何一步,

來自模型的「直覺」。


Explainable by Design

Quizzman Fanqie Engine

最重要的設計目標之一,

就是:

Every Result Must Be Explainable.

例如,

Engine 不只是輸出:

quốc

還可以進一步說明:

  • 使用了哪一個反切;
  • 選用了哪一組聲母;
  • 韻屬於哪一攝;
  • 為什麼出現介音 u
  • 為什麼保留 -c 韻尾;
  • 為什麼屬於去聲;
  • 為什麼這個候選結果優先於其他候選。

這正是大多數電子字典無法做到的。


字典與 Engine 並不是互相排斥

有趣的是,

Quizzman Fanqie Engine

依然使用字典。

只是,

字典的位置改變了。

傳統架構:

Dictionary

Answer

Quizzman Fanqie Engine:

Rule Engine

Pure Projection

Dictionary

Lexical Normalization

Final Result

字典不再主導整個推導流程。

它只是最後的:

Lexical Layer。

這也是整個架構最大的改變之一。


如果規則與字典不同呢?

這是一個非常重要的問題。

假設:

Pure Projection

得到:

A

但現代漢越字典記錄:

B

一般字典,

直接回傳:

B。

Quizzman Fanqie Engine

則會先判斷:

  • 是規則錯誤?
  • 還是古讀?
  • 還是歷史例外?
  • 還是文讀?
  • 還是字典資料尚未完整?

只有完成分析之後,

Engine 才會決定最終輸出。

因此,

它不會把所有差異,

都視為錯誤。


為什麼這件事重要?

如果目的只是:

查詢幾萬個漢字。

那麼,

一本字典已經足夠。

但如果希望:

  • 研究漢越音歷史;
  • 從反切重建讀音;
  • 由 Middle Chinese 推導 Pinyin;
  • 分析韻書;
  • 驗證音韻規則;
  • 建立語言學工具;

光有資料,

是不夠的。

真正需要的是:

一套能夠推理的系統。


一個平台,而不是一個應用程式

因此,

Quizzman Fanqie Engine

從來不是以查詢工具為目標。

它是一套:

Historical Phonology Platform。

從同一份 Middle Chinese Profile,

Engine 可以產生:

  • 漢越音;
  • Pinyin;
  • 歷史讀音;
  • NLP 所需資料;
  • 反切研究工具;
  • 更多未來的 Projection。

只有把規則放在整個架構中心,

這些能力才可能實現。


從 Lookup 到 Inference

Quizzman Fanqie Engine

與傳統漢越字典,

最大的不同,

其實可以用兩個字概括。

Dictionary

Lookup

Fanqie Engine

Inference

前者:

保存答案。

後者:

重建答案形成的過程。

前者知道:

讀音是什麼。

後者知道:

為什麼會這樣讀。

這也是 Quizzman Fanqie Engine 自第一版開始就始終堅持的理念:

不是建立一個更大的資料庫,而是建立一套真正理解並模型化一千多年來漢越音形成規律的 Historical Phonology Rule Engine。