为什么 Quizzman 不使用 AI 自动学习音韵规律?

Series 2 · 第 11 篇——不用 AI 自动学习规律 上一篇:为什么 Parser 康熙字典比 HTML Parser 更困难?

为什么 Quizzman 不使用 AI 自动学习音韵规律?

在人工智慧迅速发展的今天,许多人认为只要提供足够庞大的资料,AI 就能自动学会所有语言规律。这种方法确实适用于影像辨识、机器翻译或自然语言生成等领域。然而,历史音韵学(Historical Phonology) 面对的是另一种类型的问题。Quizzman Fanqie Engine 并不依赖 AI 自行发现或生成汉越音规律,而是建立在已经经过研究、验证与模型化的学术成果之上。这并不是 AI 能力不足,而是一项刻意的设计选择,目的是确保整个系统具备透明性、可解释性与可验证性

AI 很强,但不是所有问题都属于同一种类

人工智慧已经在许多领域取得巨大成功。

例如:

  • 语音辨识;
  • 手写文字辨识;
  • 机器翻译;
  • 语意搜寻;
  • 文字生成;
  • 影像分类。

这些问题都有共同特征:

大量资料

机率学习

预测结果

这正是现代 AI 最擅长的工作。


但历史音韵学属于另一种问题

假设我们拥有数千个汉字及其汉越音。

AI 当然可以学到:

đức

quốc

học

然而,

音韵学真正关心的问题却是:

为什么这些字会这样读?

这已经不是:

预测(Prediction)。

而是:

解释(Explanation)。


预测与解释是两件不同的事情

假设 AI 推测:

某字

quốc

接下来,

研究者一定会问:

为什么?

如果 AI 只能回答:

因为训练资料大多如此。

对历史语言学而言,

这样的答案并不足够。

研究者真正需要知道的是:

  • 哪个声母决定了起始辅音?
  • 哪个韵部形成了主要元音?
  • 为什么保留 -c 韵尾?
  • 为什么属于去声?
  • 套用了哪一条音韵规则?

因此,

研究工作不只是要求:

结果正确。

更要求:

理由清楚。


Rule Engine 拥有完整的推理路径

Quizzman Fanqie Engine

最重要的特点之一,

就是:

每一个结果,

都可以完整回溯。

例如:

德红切

声母

韵部

Middle Chinese

音韵规则

quốc

研究者可以逐步检查:

每一个推导步骤。

如果其中某一步出错,

只需要修正那一步即可。

这正是科学研究所需要的能力。


AI 很难直接指出具体规律

假设 AI 学到了:

通摄

-c

那么,

它是否还能回答:

  • 这条规律覆盖了多少比例的资料?
  • 哪些属于例外?
  • 例外形成的历史原因是什么?
  • 如果更换声母,规律是否仍成立?
  • 是否受到「等」或「开合口」影响?

通常而言,

大型模型很难完整回答这些问题。

而 Rule Engine

正是建立在这些问题之上的。


每一条规律都必须有证据

在 Quizzman Fanqie Engine 中,

没有任何规律,

只是因为:

「看起来合理」

就被加入系统。

每一条规律,

都必须经过:

资料调查

统计分析

学术比对

模型化

Audit

Regression Test

也就是说,

每一条规律,

都有可以追溯的证据。

这是历史音韵学极为重要的原则。


AI 很难区分规律与例外

假设资料如下:

95%

-c

5%

-ch

AI 可以同时学会两种模式。

但 AI 很难自行判断:

  • 这 5% 是例外?
  • 还是另一条规律?
  • 还是资料错误?
  • 还是古层汉越音?

这些判断,

属于学术研究的范畴。

不能仅依靠统计机率。


Quizzman 并不是反对 AI

有些人误以为:

不用 AI,

就等于否定 AI。

事实并非如此。

Quizzman 在许多地方,

都大量使用 AI。

例如:

  • 汉字 OCR;
  • 语意搜寻;
  • 资料分类;
  • 辅助分析;
  • 文件撰写;
  • 协助发现可疑资料,供研究者进一步检查。

换句话说,

AI 是:

Research Assistant。

而不是:

Rule Maker。


规律仍由研究者建立

在 Quizzman Fanqie Engine 中,

所有规律,

皆来自于:

  • 《广韵》;
  • 《集韵》;
  • 《康熙字典》;
  • Nguyễn Tài Cẩn;
  • 王力;
  • Baxter–Sagart;
  • 以及其他 Middle Chinese 研究成果。

完成学术验证之后,

这些规律,

才会被转化成演算法。

电脑负责:

高速、

一致、

大规模地执行规则。

但规律本身,

仍来自历史语言学研究。


AI 与 Rule Engine 可以互相补充

实际上,

AI 与 Rule Engine

并不是对立关系。

两者可以形成非常有效的合作。

例如,

AI 可以协助:

  • 发现异常案例;
  • 聚类具有共同特征的资料;
  • 提示潜在 Pattern;
  • 协助大规模资料审查。

之后,

研究者再负责:

  • 验证;
  • 对照文献;
  • 分析原因;
  • 判断是否形成新的音韵规律。

这正是 Quizzman

看待 AI 的方式。


真正重要的不是 AI 或 Rule Engine

真正重要的,

从来不是:

采用了哪一种技术。

而是:

是否可以验证。

当系统输出一个结果时,

研究者必须能回答:

  • 使用了哪一条规律?
  • 学术依据来自哪里?
  • 是否能完整重现推理流程?
  • 当新的资料出现时,是否可以重新评估?

这些都是科学研究最基本的要求。


Quizzman 选择可解释,而不是黑盒子

Quizzman Fanqie Engine

并不是为了与 AI 竞争而诞生。

相反,

整个专案在资料处理、

研究辅助等许多环节,

都积极利用 AI。

然而,

对于最核心的:

音韵规律建模(Historical Phonology Modeling)

Quizzman 选择另一条道路:

建立一套可以阅读、

可以验证、

可以解释的 Rule Engine。

在历史语言学中,

真正有价值的,

不是单纯得到正确答案。

而是能够回答:

「为什么它是正确的?」

因此,

Quizzman 并没有让 AI 自动从资料中生成一套无法解释的黑盒模型。

AI 扮演的是:

研究助理。

真正完成推理的,

仍然是建立于学术研究之上的音韵规则,

以及将这些规则实作为演算法的 Historical Phonology Rule Engine。

正因如此,

Quizzman Fanqie Engine 才能同时兼具:

  • 科学性;
  • 可追溯性;
  • 可验证性;
  • 可解释性。