Series 2 · 第 11 篇——不用 AI 自动学习规律 上一篇:为什么 Parser 康熙字典比 HTML Parser 更困难?
为什么 Quizzman 不使用 AI 自动学习音韵规律?
在人工智慧迅速发展的今天,许多人认为只要提供足够庞大的资料,AI 就能自动学会所有语言规律。这种方法确实适用于影像辨识、机器翻译或自然语言生成等领域。然而,历史音韵学(Historical Phonology) 面对的是另一种类型的问题。Quizzman Fanqie Engine 并不依赖 AI 自行发现或生成汉越音规律,而是建立在已经经过研究、验证与模型化的学术成果之上。这并不是 AI 能力不足,而是一项刻意的设计选择,目的是确保整个系统具备透明性、可解释性与可验证性。
AI 很强,但不是所有问题都属于同一种类
人工智慧已经在许多领域取得巨大成功。
例如:
- 语音辨识;
- 手写文字辨识;
- 机器翻译;
- 语意搜寻;
- 文字生成;
- 影像分类。
这些问题都有共同特征:
大量资料
↓
机率学习
↓
预测结果
这正是现代 AI 最擅长的工作。
但历史音韵学属于另一种问题
假设我们拥有数千个汉字及其汉越音。
AI 当然可以学到:
德
↓
đức
国
↓
quốc
学
↓
học
然而,
音韵学真正关心的问题却是:
为什么这些字会这样读?
这已经不是:
预测(Prediction)。
而是:
解释(Explanation)。
预测与解释是两件不同的事情
假设 AI 推测:
某字
↓
quốc
接下来,
研究者一定会问:
为什么?
如果 AI 只能回答:
因为训练资料大多如此。
对历史语言学而言,
这样的答案并不足够。
研究者真正需要知道的是:
- 哪个声母决定了起始辅音?
- 哪个韵部形成了主要元音?
- 为什么保留 -c 韵尾?
- 为什么属于去声?
- 套用了哪一条音韵规则?
因此,
研究工作不只是要求:
结果正确。
更要求:
理由清楚。
Rule Engine 拥有完整的推理路径
Quizzman Fanqie Engine
最重要的特点之一,
就是:
每一个结果,
都可以完整回溯。
例如:
国
↓
德红切
↓
声母
↓
韵部
↓
摄
↓
Middle Chinese
↓
音韵规则
↓
quốc
研究者可以逐步检查:
每一个推导步骤。
如果其中某一步出错,
只需要修正那一步即可。
这正是科学研究所需要的能力。
AI 很难直接指出具体规律
假设 AI 学到了:
通摄
↓
-c
那么,
它是否还能回答:
- 这条规律覆盖了多少比例的资料?
- 哪些属于例外?
- 例外形成的历史原因是什么?
- 如果更换声母,规律是否仍成立?
- 是否受到「等」或「开合口」影响?
通常而言,
大型模型很难完整回答这些问题。
而 Rule Engine
正是建立在这些问题之上的。
每一条规律都必须有证据
在 Quizzman Fanqie Engine 中,
没有任何规律,
只是因为:
「看起来合理」
就被加入系统。
每一条规律,
都必须经过:
资料调查
↓
统计分析
↓
学术比对
↓
模型化
↓
Audit
↓
Regression Test
也就是说,
每一条规律,
都有可以追溯的证据。
这是历史音韵学极为重要的原则。
AI 很难区分规律与例外
假设资料如下:
95%
↓
-c
5%
↓
-ch
AI 可以同时学会两种模式。
但 AI 很难自行判断:
- 这 5% 是例外?
- 还是另一条规律?
- 还是资料错误?
- 还是古层汉越音?
这些判断,
属于学术研究的范畴。
不能仅依靠统计机率。
Quizzman 并不是反对 AI
有些人误以为:
不用 AI,
就等于否定 AI。
事实并非如此。
Quizzman 在许多地方,
都大量使用 AI。
例如:
- 汉字 OCR;
- 语意搜寻;
- 资料分类;
- 辅助分析;
- 文件撰写;
- 协助发现可疑资料,供研究者进一步检查。
换句话说,
AI 是:
Research Assistant。
而不是:
Rule Maker。
规律仍由研究者建立
在 Quizzman Fanqie Engine 中,
所有规律,
皆来自于:
- 《广韵》;
- 《集韵》;
- 《康熙字典》;
- Nguyễn Tài Cẩn;
- 王力;
- Baxter–Sagart;
- 以及其他 Middle Chinese 研究成果。
完成学术验证之后,
这些规律,
才会被转化成演算法。
电脑负责:
高速、
一致、
大规模地执行规则。
但规律本身,
仍来自历史语言学研究。
AI 与 Rule Engine 可以互相补充
实际上,
AI 与 Rule Engine
并不是对立关系。
两者可以形成非常有效的合作。
例如,
AI 可以协助:
- 发现异常案例;
- 聚类具有共同特征的资料;
- 提示潜在 Pattern;
- 协助大规模资料审查。
之后,
研究者再负责:
- 验证;
- 对照文献;
- 分析原因;
- 判断是否形成新的音韵规律。
这正是 Quizzman
看待 AI 的方式。
真正重要的不是 AI 或 Rule Engine
真正重要的,
从来不是:
采用了哪一种技术。
而是:
是否可以验证。
当系统输出一个结果时,
研究者必须能回答:
- 使用了哪一条规律?
- 学术依据来自哪里?
- 是否能完整重现推理流程?
- 当新的资料出现时,是否可以重新评估?
这些都是科学研究最基本的要求。
Quizzman 选择可解释,而不是黑盒子
Quizzman Fanqie Engine
并不是为了与 AI 竞争而诞生。
相反,
整个专案在资料处理、
研究辅助等许多环节,
都积极利用 AI。
然而,
对于最核心的:
音韵规律建模(Historical Phonology Modeling)
Quizzman 选择另一条道路:
建立一套可以阅读、
可以验证、
可以解释的 Rule Engine。
在历史语言学中,
真正有价值的,
不是单纯得到正确答案。
而是能够回答:
「为什么它是正确的?」
因此,
Quizzman 并没有让 AI 自动从资料中生成一套无法解释的黑盒模型。
AI 扮演的是:
研究助理。
真正完成推理的,
仍然是建立于学术研究之上的音韵规则,
以及将这些规则实作为演算法的 Historical Phonology Rule Engine。
正因如此,
Quizzman Fanqie Engine 才能同时兼具:
- 科学性;
- 可追溯性;
- 可验证性;
- 可解释性。