Quizzman Fanqie Engine 的发展历程:从查询工具到历史音韵推论平台

Quizzman Fanqie Engine 系列(第十一篇)

上一篇:为什么 Quizzman Fanqie Engine 不是一本汉越字典?

Quizzman Fanqie Engine 的发展历程:从查询工具到历史音韵推论平台

Quizzman Fanqie Engine 并非一蹴而就,而是多年反切研究、汉越音研究与中古汉语研究累积的成果。随着研究不断深入,Engine 的整体架构也历经多次重大改版。每一个版本都解决了新的问题,突破前一代的限制,使系统一步步朝着最初的目标迈进:以演算法建模汉越音的形成过程,而不是将结果储存成一本大型字典。

最初的目标

Quizzman Fanqie Engine 最初的想法其实非常单纯。

是否能仅凭反切,就推导出汉越音?

乍看之下,

这似乎只是个查询问题。

只需要:

  • 撷取声母。
  • 撷取韵母。
  • 将两者组合。

然而,

真正开始实作后,

很快便遇到一个重大挑战。

反切所包含的资讯,

远远不只有:

  • 声母。
  • 韵母。

还包括:

  • 摄。
  • 等。
  • 开口/合口。
  • 平、上、去、入四声。
  • 越南语历史音变。
  • 多个汉越音层次。

因此,

问题的复杂度远超过最初的想像。

第一个版本

最初的版本,

主要聚焦于最基本的能力:

  • 解析反切。
  • 分离声母。
  • 分离韵母。
  • 产生汉越音。

这是一个概念验证(Proof of Concept)的阶段。

Engine 已经能处理不少基本反切。

然而,

例外情况仍然很多。

音韵规律尚未完整建模,

许多结果仍需依赖额外资料修正。

当资料越来越多

随着反切资料与汉越音资料快速增加,

团队开始面临一个重要问题:

应该继续累积资料,还是回头完善规律?

这项决策,

直接影响了之后整个架构。

若持续累积资料,

Engine 最终会变成一本大型字典。

若回头建立规律,

开发速度虽然较慢,

却能大幅提升推论能力。

Quizzman 最终选择了后者。

从 Data-driven 转向 Rule-driven

这是整个专案最大的转折点。

过去,

Engine 记录的是:

字 A
 ↓
读音 A

字 B
 ↓
读音 B

之后,

改为保存:

规律 A
规律 B
规律 C

每一条规律,

都能套用到数百甚至数千个汉字。

也正是在这个阶段,

Pure Projection 的概念逐渐形成。

将 Middle Chinese 独立成一层

另一项重大变革,

是将 Middle Chinese(中古汉语) 抽离成独立的中介层。

最初,

中古音重建与汉越音推导同时进行。

这使得系统:

  • 难以测试。
  • 难以扩充。
  • 难以解释。

重新设计后,

整体架构变为:

反切
    ↓
Middle Chinese
    ↓
汉越音

这样的分层带来许多好处:

  • 每个阶段都能独立测试。
  • 更容易替换中古音重建模型。
  • 更容易加入拼音推导。
  • 更容易支援其他汉字读音系统。

这也成为今日整个架构的核心。

将音韵规律与词汇层分离

后续版本最重要的改动之一,

就是彻底区分:

音韵规律

与:

词汇层

两者回答的是完全不同的问题。

音韵规律回答:

一个音节依照历史规律应如何演变?

词汇层则回答:

现代越南语实际使用哪一种读法?

若将两者混在一起,

Engine 将难以维护。

因此,

Quizzman Fanqie Engine 将它们拆分成两个独立步骤:

Pure Projection
        ↓
Lexical Normalization

这也是整个架构最关键的设计之一。

声调系统重新设计

声调演算法,

也是改动最大的模组之一。

最初,

Engine 直接处理:

  • 平(ngang)
  • 玄(huyền)
  • 问(hỏi)
  • 跌(ngã)
  • 锐(sắc)
  • 重(nặng)

虽然可正常运作,

但逐渐暴露不少限制。

经过对汉越音与 Nguyễn Tài Cẩn 研究成果的整理后,

Engine 改采 Eight Tone Slot 模型。

先处理:

  • 阴平
  • 阳平
  • 阴上
  • 阳上
  • 阴去
  • 阳去
  • 阴入
  • 阳入

最后再映射为现代越南语六声。

如此一来,

整个推导过程都能保留完整的历史音韵资讯。

Candidate Ranking

当反切资料逐渐完善后,

新的问题也随之出现。

许多汉字同时具有:

  • 多种反切。
  • 多个文献来源。
  • 多种重建方案。

若任意选取其中一种,

结果便容易不稳定。

因此,

Quizzman Fanqie Engine 加入了 Candidate Ranking

系统会根据多项指标评估每个候选结果,例如:

  • 文献来源品质。
  • 是否符合音韵规律。
  • 标准汉越音层。
  • 使用普遍程度。
  • 整体可信度。

如此一来,

Engine 能在保留所有候选方案的同时,

选出最合适的结果。

Confidence Score

随着 Engine 越来越复杂,

另一个问题也浮现:

使用者如何知道哪个结果比较可信?

因此,

Engine 不再只回传单一答案,

而加入多层 Confidence Score

例如:

  • Source Confidence
  • Phonological Confidence
  • Lexical Confidence
  • Final Confidence

每项指标,

分别反映推论流程中的不同面向。

这也是 Engine 迈向可验证系统的重要一步。

测试系统也同步演进

架构越庞大,

Regression(回归错误)的风险也越高。

一条音韵规律的小修改,

可能影响数千个汉字。

因此,

后续版本加入了完整测试流程:

  • Golden Fixture
  • Batch Audit
  • Regression Test
  • Stress Test
  • Tone Audit
  • Candidate Audit

目的不只是找出新的错误,

更重要的是:

确保已经正确的规律,不会在未来版本中被破坏。

从汉越音 Engine 到共用平台

最初,

Quizzman Fanqie Engine 的目标,

只是推导汉越音。

然而,

当 Middle Chinese 成为独立中介层后,

整个平台便具备更高的扩充能力。

同一份 Middle Chinese Profile,

可以同时用于:

  • 汉越音推导。
  • 拼音生成。
  • 反切研究。
  • 自然语言处理(NLP)。
  • 字典系统。

因此,

Quizzman Fanqie Engine 已从单一工具,

逐步发展为多项应用共享的基础平台。

V6:从「查询」走向「推论」

V6 是整个架构的重要里程碑。

它不只是新增更多音韵规律,

更完整落实了整个设计理念:

  • Middle Chinese 作为独立中介层。
  • 音韵规律与词汇层彼此独立。
  • 完整建模 Eight Tone Slot。
  • Candidate Ranking 选择最佳候选结果。
  • Confidence Score 评估每一步推论。
  • 明确区分 Pure Projection 与 Hybrid。

因此,

Quizzman Fanqie Engine 已不再只是汉越音转换程式,

而是真正的 Historical Phonology Inference Engine

发展仍在持续

虽然目前架构已相当成熟,

Quizzman Fanqie Engine 的发展并未停止。

历史音韵学仍有极大的研究空间。

未来,

同一套 Middle Chinese 平台,

还可支援:

  • 汉日音(Kan-on、Go-on)。
  • 汉韩音。
  • 汉语各地方言。
  • 多个历史音层重建。
  • 汉文 NLP 与 AI 应用。

这也是 Quizzman 长期努力的方向:

不只是打造一套汉越音查询工具,而是建立一个面向东亚历史语言研究的音韵计算平台。