Quizzman Fanqie Engine 系列(第十一篇)
上一篇:为什么 Quizzman Fanqie Engine 不是一本汉越字典?
Quizzman Fanqie Engine 的发展历程:从查询工具到历史音韵推论平台
Quizzman Fanqie Engine 并非一蹴而就,而是多年反切研究、汉越音研究与中古汉语研究累积的成果。随着研究不断深入,Engine 的整体架构也历经多次重大改版。每一个版本都解决了新的问题,突破前一代的限制,使系统一步步朝着最初的目标迈进:以演算法建模汉越音的形成过程,而不是将结果储存成一本大型字典。
最初的目标
Quizzman Fanqie Engine 最初的想法其实非常单纯。
是否能仅凭反切,就推导出汉越音?
乍看之下,
这似乎只是个查询问题。
只需要:
- 撷取声母。
- 撷取韵母。
- 将两者组合。
然而,
真正开始实作后,
很快便遇到一个重大挑战。
反切所包含的资讯,
远远不只有:
- 声母。
- 韵母。
还包括:
- 摄。
- 等。
- 开口/合口。
- 平、上、去、入四声。
- 越南语历史音变。
- 多个汉越音层次。
因此,
问题的复杂度远超过最初的想像。
第一个版本
最初的版本,
主要聚焦于最基本的能力:
- 解析反切。
- 分离声母。
- 分离韵母。
- 产生汉越音。
这是一个概念验证(Proof of Concept)的阶段。
Engine 已经能处理不少基本反切。
然而,
例外情况仍然很多。
音韵规律尚未完整建模,
许多结果仍需依赖额外资料修正。
当资料越来越多
随着反切资料与汉越音资料快速增加,
团队开始面临一个重要问题:
应该继续累积资料,还是回头完善规律?
这项决策,
直接影响了之后整个架构。
若持续累积资料,
Engine 最终会变成一本大型字典。
若回头建立规律,
开发速度虽然较慢,
却能大幅提升推论能力。
Quizzman 最终选择了后者。
从 Data-driven 转向 Rule-driven
这是整个专案最大的转折点。
过去,
Engine 记录的是:
字 A
↓
读音 A
字 B
↓
读音 B
之后,
改为保存:
规律 A
规律 B
规律 C
每一条规律,
都能套用到数百甚至数千个汉字。
也正是在这个阶段,
Pure Projection 的概念逐渐形成。
将 Middle Chinese 独立成一层
另一项重大变革,
是将 Middle Chinese(中古汉语) 抽离成独立的中介层。
最初,
中古音重建与汉越音推导同时进行。
这使得系统:
- 难以测试。
- 难以扩充。
- 难以解释。
重新设计后,
整体架构变为:
反切
↓
Middle Chinese
↓
汉越音
这样的分层带来许多好处:
- 每个阶段都能独立测试。
- 更容易替换中古音重建模型。
- 更容易加入拼音推导。
- 更容易支援其他汉字读音系统。
这也成为今日整个架构的核心。
将音韵规律与词汇层分离
后续版本最重要的改动之一,
就是彻底区分:
音韵规律
与:
词汇层
两者回答的是完全不同的问题。
音韵规律回答:
一个音节依照历史规律应如何演变?
词汇层则回答:
现代越南语实际使用哪一种读法?
若将两者混在一起,
Engine 将难以维护。
因此,
Quizzman Fanqie Engine 将它们拆分成两个独立步骤:
Pure Projection
↓
Lexical Normalization
这也是整个架构最关键的设计之一。
声调系统重新设计
声调演算法,
也是改动最大的模组之一。
最初,
Engine 直接处理:
- 平(ngang)
- 玄(huyền)
- 问(hỏi)
- 跌(ngã)
- 锐(sắc)
- 重(nặng)
虽然可正常运作,
但逐渐暴露不少限制。
经过对汉越音与 Nguyễn Tài Cẩn 研究成果的整理后,
Engine 改采 Eight Tone Slot 模型。
先处理:
- 阴平
- 阳平
- 阴上
- 阳上
- 阴去
- 阳去
- 阴入
- 阳入
最后再映射为现代越南语六声。
如此一来,
整个推导过程都能保留完整的历史音韵资讯。
Candidate Ranking
当反切资料逐渐完善后,
新的问题也随之出现。
许多汉字同时具有:
- 多种反切。
- 多个文献来源。
- 多种重建方案。
若任意选取其中一种,
结果便容易不稳定。
因此,
Quizzman Fanqie Engine 加入了 Candidate Ranking。
系统会根据多项指标评估每个候选结果,例如:
- 文献来源品质。
- 是否符合音韵规律。
- 标准汉越音层。
- 使用普遍程度。
- 整体可信度。
如此一来,
Engine 能在保留所有候选方案的同时,
选出最合适的结果。
Confidence Score
随着 Engine 越来越复杂,
另一个问题也浮现:
使用者如何知道哪个结果比较可信?
因此,
Engine 不再只回传单一答案,
而加入多层 Confidence Score。
例如:
- Source Confidence
- Phonological Confidence
- Lexical Confidence
- Final Confidence
每项指标,
分别反映推论流程中的不同面向。
这也是 Engine 迈向可验证系统的重要一步。
测试系统也同步演进
架构越庞大,
Regression(回归错误)的风险也越高。
一条音韵规律的小修改,
可能影响数千个汉字。
因此,
后续版本加入了完整测试流程:
- Golden Fixture
- Batch Audit
- Regression Test
- Stress Test
- Tone Audit
- Candidate Audit
目的不只是找出新的错误,
更重要的是:
确保已经正确的规律,不会在未来版本中被破坏。
从汉越音 Engine 到共用平台
最初,
Quizzman Fanqie Engine 的目标,
只是推导汉越音。
然而,
当 Middle Chinese 成为独立中介层后,
整个平台便具备更高的扩充能力。
同一份 Middle Chinese Profile,
可以同时用于:
- 汉越音推导。
- 拼音生成。
- 反切研究。
- 自然语言处理(NLP)。
- 字典系统。
因此,
Quizzman Fanqie Engine 已从单一工具,
逐步发展为多项应用共享的基础平台。
V6:从「查询」走向「推论」
V6 是整个架构的重要里程碑。
它不只是新增更多音韵规律,
更完整落实了整个设计理念:
- Middle Chinese 作为独立中介层。
- 音韵规律与词汇层彼此独立。
- 完整建模 Eight Tone Slot。
- Candidate Ranking 选择最佳候选结果。
- Confidence Score 评估每一步推论。
- 明确区分 Pure Projection 与 Hybrid。
因此,
Quizzman Fanqie Engine 已不再只是汉越音转换程式,
而是真正的 Historical Phonology Inference Engine。
发展仍在持续
虽然目前架构已相当成熟,
Quizzman Fanqie Engine 的发展并未停止。
历史音韵学仍有极大的研究空间。
未来,
同一套 Middle Chinese 平台,
还可支援:
- 汉日音(Kan-on、Go-on)。
- 汉韩音。
- 汉语各地方言。
- 多个历史音层重建。
- 汉文 NLP 与 AI 应用。
这也是 Quizzman 长期努力的方向:
不只是打造一套汉越音查询工具,而是建立一个面向东亚历史语言研究的音韵计算平台。