为什么 Quizzman Fanqie Engine 并不是一部汉越字典?

Series 2 · 第 10 篇——为什么 Quizzman Fanqie Engine 不是汉越字典 上一篇:准确率与 Benchmark:Quizzman Fanqie Engine 的评估方法

为什么 Quizzman Fanqie Engine 并不是一部汉越字典?

初次接触 Quizzman Fanqie Engine 时,许多人都会认为它只是一套汉越音查询工具。这样的理解并没有错,但并不完整。Engine 确实可以输出汉越音、Pinyin,以及各种音韵资讯,因此很容易被误认为电子字典。然而,如果深入观察整个运作流程,就会发现两者解决的是完全不同的问题。字典储存的是结果;Quizzman Fanqie Engine 重建的是结果形成的过程。 这正是 Dictionary LookupHistorical Phonology Inference Engine 之间最根本的差异。

汉越字典是如何工作的?

大多数电子字典,

都采用相同的方式。

使用者输入:

系统查询资料表:

quốc

如果再输入:

系统再次查询:

đức

每一个汉字,

都是一笔独立资料。

如果要新增新的汉字,

只需要加入新的纪录即可。

这种架构:

  • 容易开发;
  • 容易理解;
  • 查询速度极快;
  • 非常适合日常检索。

对一般使用而言,

这样的方法完全足够。


查表方法的限制

但这种架构,

存在一个根本性的限制。

字典知道:

quốc

却不知道:

  • 为什么读作 quốc
  • 为什么不是 cuốc
  • 为什么是去声(sắc)?
  • 为什么保留 -c 韵尾?
  • 为什么声母变成 qu-

换句话说,

字典只保存:

结果(Result)

却没有保存:

形成结果的过程(Reasoning)


如果遇到字典里没有的汉字呢?

这是一个最简单的测试。

如果某个汉字不存在于资料库,

一般字典只能回答:

查无资料。

或者:

没有收录。

这是很正常的。

因为字典不知道:

读音是如何形成的。

它只能回答:

自己已经记录过的内容。


Fanqie Engine 的思考方式完全不同

对 Quizzman Fanqie Engine 而言,

真正的问题不是:

这个字怎么读?

而是:

这个读音是如何形成的?

两个问题看起来相似,

本质却完全不同。

如果 Engine 已知:

  • 反切;
  • 声母;
  • 韵部;
  • 摄;
  • 等;
  • 开合口;
  • 平上去入;
  • 汉越音的历史演变;

那么,

即使从未遇过这个汉字,

它仍然可以推导出合理的汉越音。

这就是最大的差异。


Engine 并不是从汉字开始

字典的流程:

汉字

读音

Quizzman Fanqie Engine 的流程则是:

汉字

反切

Middle Chinese

音韵规则

汉越音

换句话说,

Engine 保存的,

不是数万笔读音。

而是:

产生这些读音的规则。


规则比资料更有价值

假设有一千个汉字,

都属于相同的音韵类型。

字典需要保存:

1000

笔资料。

Quizzman Fanqie Engine

只需要:

1

条规则。

例如:

通摄

Rule A

梗摄

Rule B

流摄

Rule C

每一条规则,

都可以同时适用于数百、

甚至数千个汉字。

这就是 Rule Engine 的思维。


并不是 AI 在「猜」

今天,

许多人看到能够推导结果的系统,

第一个反应就是:

AI。

Quizzman Fanqie Engine

并不是如此。

它不是:

猜测。

也不是:

统计预测。

每一步,

都依据具体的音韵规则。

例如:

声母

决定起始辅音

决定韵尾

影响元音

清浊声母

影响声调

每一步都可以说明。

没有任何一步,

来自模型的「直觉」。


Explainable by Design

Quizzman Fanqie Engine

最重要的设计目标之一,

就是:

Every Result Must Be Explainable.

例如,

Engine 不只是输出:

quốc

还可以进一步说明:

  • 使用了哪一个反切;
  • 选用了哪一组声母;
  • 韵属于哪一摄;
  • 为什么出现介音 u
  • 为什么保留 -c 韵尾;
  • 为什么属于去声;
  • 为什么这个候选结果优先于其他候选。

这正是大多数电子字典无法做到的。


字典与 Engine 并不是互相排斥

有趣的是,

Quizzman Fanqie Engine

依然使用字典。

只是,

字典的位置改变了。

传统架构:

Dictionary

Answer

Quizzman Fanqie Engine:

Rule Engine

Pure Projection

Dictionary

Lexical Normalization

Final Result

字典不再主导整个推导流程。

它只是最后的:

Lexical Layer。

这也是整个架构最大的改变之一。


如果规则与字典不同呢?

这是一个非常重要的问题。

假设:

Pure Projection

得到:

A

但现代汉越字典记录:

B

一般字典,

直接回传:

B。

Quizzman Fanqie Engine

则会先判断:

  • 是规则错误?
  • 还是古读?
  • 还是历史例外?
  • 还是文读?
  • 还是字典资料尚未完整?

只有完成分析之后,

Engine 才会决定最终输出。

因此,

它不会把所有差异,

都视为错误。


为什么这件事重要?

如果目的只是:

查询几万个汉字。

那么,

一本字典已经足够。

但如果希望:

  • 研究汉越音历史;
  • 从反切重建读音;
  • 由 Middle Chinese 推导 Pinyin;
  • 分析韵书;
  • 验证音韵规则;
  • 建立语言学工具;

光有资料,

是不够的。

真正需要的是:

一套能够推理的系统。


一个平台,而不是一个应用程式

因此,

Quizzman Fanqie Engine

从来不是以查询工具为目标。

它是一套:

Historical Phonology Platform。

从同一份 Middle Chinese Profile,

Engine 可以产生:

  • 汉越音;
  • Pinyin;
  • 历史读音;
  • NLP 所需资料;
  • 反切研究工具;
  • 更多未来的 Projection。

只有把规则放在整个架构中心,

这些能力才可能实现。


从 Lookup 到 Inference

Quizzman Fanqie Engine

与传统汉越字典,

最大的不同,

其实可以用两个字概括。

Dictionary

Lookup

Fanqie Engine

Inference

前者:

保存答案。

后者:

重建答案形成的过程。

前者知道:

读音是什么。

后者知道:

为什么会这样读。

这也是 Quizzman Fanqie Engine 自第一版开始就始终坚持的理念:

不是建立一个更大的资料库,而是建立一套真正理解并模型化一千多年来汉越音形成规律的 Historical Phonology Rule Engine。