Series 2 · 第 12 篇──语言本体(Middle Chinese Hub)。上一篇:为什么 Quizzman 不使用 AI 自行学习音韵规律
Quizzman Fanqie Engine 与语言本体(Ontology):当汉越音、拼音与中古汉语属于同一知识体系
对许多人而言,Quizzman Fanqie Engine 只是把反切转换成汉越音或汉语拼音的工具。然而,这只是整个专案极小的一部分。Fanqie Engine 最重要的价值,在于建立一套 Ontology(本体),使每一个汉字不再只是字典中的一笔资料,而是一个与多种音系、多种语言及多个历史层次互相连结的知识节点。换句话说,Fanqie Engine 不只是让电脑「读出」汉字,更让电脑理解不同读音彼此之间的关系。
传统字典如何储存资料?
目前大部分电子字典都采用十分直接的方式。
例如:
学
↓
học
↓
xué
↓
study
或:
| 汉字 | 汉越音 | 拼音 | |------|---------|-------| | 学 | học | xué | | 国 | quốc | guó | | 明 | minh | míng |
这种方式非常适合查询。
但存在一个限制。
电脑只知道:
「学」具有汉越音 học,也具有拼音 xué。
电脑并不知道为什么这两种读音彼此相关。
事实上,汉越音与拼音并非各自独立产生
若仔细观察便会发现:
汉越音与现代普通话并不是两套毫无关联的系统。
它们共同来自同一个祖先:
Middle Chinese(中古汉语)。
可以把演变理解为:
Middle Chinese
│
▼
汉越音
│
▼
học
同时:
Middle Chinese
│
▼
Mandarin(现代官话)
│
▼
xué
因此:
汉越音并不是由拼音演变而来;
拼音也不是由汉越音演变而来。
两者都是由同一套历史音系分化出的不同分支。
这正是 Quizzman Fanqie Engine 最重要的设计理念。
Middle Chinese 是整个 Ontology 的核心节点
在 Quizzman 的 Ontology(本体) 中,
汉字不会直接连结到汉越音或拼音。
Engine 会先建立一份 Middle Chinese Profile(中古汉语音系描述)。
例如:
学
│
▼
Middle Chinese Profile
其中包含:
- 声母
- 韵
- 摄
- 等
- 开口/合口
- 声调
- 反切
- 重建音标
建立完成后,
Engine 才开始推导其他音系。
一份 Middle Chinese Profile 可以推导多种读音系统
当 Middle Chinese Profile 建立完成后,
Engine 可以投射(Projection)到不同语言系统。
例如:
Middle Chinese
│
├────► 汉越音
│
└────► 拼音
未来还可继续扩充:
- Kan-on(日本汉音)
- Go-on(吴音)
- Tō-on(唐音)
- 韩国汉字音(Hanja Reading)
- 各种汉语方言
- 其他历史重建系统
因此 Fanqie Engine 并非仅服务于汉越音,而是一个可共用的音韵平台。
每一个汉字都是一个知识节点
在 Ontology 中,
汉字不再只是 Unicode 字元。
它是一个 Node(节点)。
例如:
Unicode
│
│
Meaning ──── 学 ─── Radical
│
│
Middle Chinese
╱ ╲
╱ ╲
汉越音 拼音
╲ ╱
╲ ╱
Historical Sources
此节点可以同时连结:
- Unicode
- 部首
- 字义
- 反切
- Middle Chinese
- 汉越音
- 拼音
- 异体字
- 各历史读音层
- 韵书来源
每一条连结都具有明确的语言学意义。
透过演算法建立汉越音与拼音的关联
Fanqie Engine 最重要的特点之一,就是:
并不直接储存汉越音与拼音之间的对应。
它们之间的关系完全由演算法推导。
例如:
反切
│
▼
Middle Chinese
│
├────► Projection HV
│
└────► Projection PY
因此,
Engine 知道:
学
│
├──► học
│
└──► xué
是由同一份 Middle Chinese Profile 推导而来。
而不是资料库里两笔彼此独立的纪录。
Ontology 让电脑真正理解资料
若只有字典,
电脑只知道:
国 → quốc
国 → guó
而在 Ontology 中,
电脑还知道:
- 两种读音来自同一份 Middle Chinese Profile。
- 它们具有相同历史声母。
- 属于相同韵部。
- 拥有相同历史声调。
- 差异仅来自不同语言各自的音变规律。
这些知识,是一般查询表无法表示的。
不只是查询工具
这样的 Ontology 可支援许多应用。
依读音搜寻
即使使用者只知道:
quốc
Engine 仍可找到:
国
并同时提供:
- guó
- Middle Chinese Profile
- 历史音韵资讯
多语言连结
同一汉字可同时连结:
- 汉越音
- 拼音
- Kanji
- Hanja
- 各历史读音层
这对 Sino-Xenic(汉字文化圈借词音)研究尤其重要。
发现音韵关系
Engine 不只知道两个字是否同音,
还知道:
- 是否同一声母。
- 是否同一韵部。
- 是否因同一历史来源而相似。
- 或只是现代越南语中的偶然同音。
这些都是历史语言研究的重要资讯。
Fanqie Engine 是 Quizzman 的基础设施
从系统架构角度来看,
Fanqie Engine 并不是最终产品。
它是一层 Infrastructure Layer(基础设施层)。
Quizzman 其他产品,例如:
- 汉越字典
- 拼音查询
- 反切分析工具
- 音韵研究平台
- 语音搜寻系统
- AI 汉字学习工具
皆可共用同一套由 Fanqie Engine 建立的 Ontology。
因此所有产品共享同一知识来源,而不需要维护多份彼此独立的资料库。
从推导工具走向知识平台
Quizzman Fanqie Engine 最初的目标,是根据反切推导汉越音。
随着专案发展,它逐渐扩展成更大的方向:
建立一套以 Middle Chinese(中古汉语)为核心的语言 Ontology(本体)。
在这套模型中,
汉越音与拼音不再是两笔人工对应的资料,
而是由同一份历史音系推导出的不同结果。
正因如此,
Fanqie Engine 不只回答:
「这个字怎么读?」
更能回答:
「不同读音系统之间为什么彼此相关?」
这也是 Quizzman 的长期目标:
以 Fanqie Engine 为基础,建立一套完整的 汉字 Ontology(汉字本体),让每一个汉字都能与其历史音韵、字义、韵书来源及东亚各语言读音,共同组成一张统一且可推理的知识网路。