Series 2 · 第 10 篇——为什么 Quizzman Fanqie Engine 不是汉越字典 上一篇:准确率与 Benchmark:Quizzman Fanqie Engine 的评估方法
为什么 Quizzman Fanqie Engine 并不是一部汉越字典?
初次接触 Quizzman Fanqie Engine 时,许多人都会认为它只是一套汉越音查询工具。这样的理解并没有错,但并不完整。Engine 确实可以输出汉越音、Pinyin,以及各种音韵资讯,因此很容易被误认为电子字典。然而,如果深入观察整个运作流程,就会发现两者解决的是完全不同的问题。字典储存的是结果;Quizzman Fanqie Engine 重建的是结果形成的过程。 这正是 Dictionary Lookup 与 Historical Phonology Inference Engine 之间最根本的差异。
汉越字典是如何工作的?
大多数电子字典,
都采用相同的方式。
使用者输入:
国
系统查询资料表:
国
↓
quốc
如果再输入:
德
系统再次查询:
德
↓
đức
每一个汉字,
都是一笔独立资料。
如果要新增新的汉字,
只需要加入新的纪录即可。
这种架构:
- 容易开发;
- 容易理解;
- 查询速度极快;
- 非常适合日常检索。
对一般使用而言,
这样的方法完全足够。
查表方法的限制
但这种架构,
存在一个根本性的限制。
字典知道:
国
↓
quốc
却不知道:
- 为什么读作 quốc?
- 为什么不是 cuốc?
- 为什么是去声(sắc)?
- 为什么保留 -c 韵尾?
- 为什么声母变成 qu-?
换句话说,
字典只保存:
结果(Result)
却没有保存:
形成结果的过程(Reasoning)。
如果遇到字典里没有的汉字呢?
这是一个最简单的测试。
如果某个汉字不存在于资料库,
一般字典只能回答:
查无资料。
或者:
没有收录。
这是很正常的。
因为字典不知道:
读音是如何形成的。
它只能回答:
自己已经记录过的内容。
Fanqie Engine 的思考方式完全不同
对 Quizzman Fanqie Engine 而言,
真正的问题不是:
这个字怎么读?
而是:
这个读音是如何形成的?
两个问题看起来相似,
本质却完全不同。
如果 Engine 已知:
- 反切;
- 声母;
- 韵部;
- 摄;
- 等;
- 开合口;
- 平上去入;
- 汉越音的历史演变;
那么,
即使从未遇过这个汉字,
它仍然可以推导出合理的汉越音。
这就是最大的差异。
Engine 并不是从汉字开始
字典的流程:
汉字
↓
读音
Quizzman Fanqie Engine 的流程则是:
汉字
↓
反切
↓
Middle Chinese
↓
音韵规则
↓
汉越音
换句话说,
Engine 保存的,
不是数万笔读音。
而是:
产生这些读音的规则。
规则比资料更有价值
假设有一千个汉字,
都属于相同的音韵类型。
字典需要保存:
1000
笔资料。
Quizzman Fanqie Engine
只需要:
1
条规则。
例如:
通摄
↓
Rule A
梗摄
↓
Rule B
流摄
↓
Rule C
每一条规则,
都可以同时适用于数百、
甚至数千个汉字。
这就是 Rule Engine 的思维。
并不是 AI 在「猜」
今天,
许多人看到能够推导结果的系统,
第一个反应就是:
AI。
Quizzman Fanqie Engine
并不是如此。
它不是:
猜测。
也不是:
统计预测。
每一步,
都依据具体的音韵规则。
例如:
声母
↓
决定起始辅音
摄
↓
决定韵尾
等
↓
影响元音
清浊声母
↓
影响声调
每一步都可以说明。
没有任何一步,
来自模型的「直觉」。
Explainable by Design
Quizzman Fanqie Engine
最重要的设计目标之一,
就是:
Every Result Must Be Explainable.
例如,
Engine 不只是输出:
国
↓
quốc
还可以进一步说明:
- 使用了哪一个反切;
- 选用了哪一组声母;
- 韵属于哪一摄;
- 为什么出现介音 u;
- 为什么保留 -c 韵尾;
- 为什么属于去声;
- 为什么这个候选结果优先于其他候选。
这正是大多数电子字典无法做到的。
字典与 Engine 并不是互相排斥
有趣的是,
Quizzman Fanqie Engine
依然使用字典。
只是,
字典的位置改变了。
传统架构:
Dictionary
↓
Answer
Quizzman Fanqie Engine:
Rule Engine
↓
Pure Projection
↓
Dictionary
↓
Lexical Normalization
↓
Final Result
字典不再主导整个推导流程。
它只是最后的:
Lexical Layer。
这也是整个架构最大的改变之一。
如果规则与字典不同呢?
这是一个非常重要的问题。
假设:
Pure Projection
得到:
A
但现代汉越字典记录:
B
一般字典,
直接回传:
B。
Quizzman Fanqie Engine
则会先判断:
- 是规则错误?
- 还是古读?
- 还是历史例外?
- 还是文读?
- 还是字典资料尚未完整?
只有完成分析之后,
Engine 才会决定最终输出。
因此,
它不会把所有差异,
都视为错误。
为什么这件事重要?
如果目的只是:
查询几万个汉字。
那么,
一本字典已经足够。
但如果希望:
- 研究汉越音历史;
- 从反切重建读音;
- 由 Middle Chinese 推导 Pinyin;
- 分析韵书;
- 验证音韵规则;
- 建立语言学工具;
光有资料,
是不够的。
真正需要的是:
一套能够推理的系统。
一个平台,而不是一个应用程式
因此,
Quizzman Fanqie Engine
从来不是以查询工具为目标。
它是一套:
Historical Phonology Platform。
从同一份 Middle Chinese Profile,
Engine 可以产生:
- 汉越音;
- Pinyin;
- 历史读音;
- NLP 所需资料;
- 反切研究工具;
- 更多未来的 Projection。
只有把规则放在整个架构中心,
这些能力才可能实现。
从 Lookup 到 Inference
Quizzman Fanqie Engine
与传统汉越字典,
最大的不同,
其实可以用两个字概括。
Dictionary
↓
Lookup
Fanqie Engine
↓
Inference
前者:
保存答案。
后者:
重建答案形成的过程。
前者知道:
读音是什么。
后者知道:
为什么会这样读。
这也是 Quizzman Fanqie Engine 自第一版开始就始终坚持的理念:
不是建立一个更大的资料库,而是建立一套真正理解并模型化一千多年来汉越音形成规律的 Historical Phonology Rule Engine。