为日语的复杂现实而打造的解析器。
akusento 并不是给词典查询套上一层漂亮的界面。它是一款语境感知的日语音高重音解析器,目标是应对日语在真实句子中的样子:会活用、会复合、会接助词、会被标点打断,还充满各种边缘情况。
从日语原文到可读的音高重音。
系统把成熟的形态素分析、词汇音高单元合并和一套自定义规则引擎结合起来。目标听起来很简单:把困难而抽象的音高重音信息,变成学习者可以直接读懂的内容,同时不掩盖得出这一结果所应用的规则和语法判断。
切分句子
输入文本会用 MeCab 和 UniDic 切分成词对象。每个单元都带着后续判断所需的信息:表层形、词元、读音、词性、活用细节、音高下降候选和语法元数据。
合并音高单元
当词典或组合器查询表明相邻的形态素单元会作为同一个重音短语运作时,它们就会被合并成更大的音高单元。
应用语境规则
完成词汇音高单元合并后,句子级规则引擎会处理后缀重音、助词、助动词、活用、复合词、语法边界和已知例外,再决定重音在语境中如何表现。
渲染结果
解析结果以结构化数据返回前端,并渲染成可读的日语:假名注音、音高下降标记、清化标记、按颜色区分的模式类别,以及可点击查看的已应用规则说明。
在真实散文上测得,而不是人为构造的例子。
一旦输入不再是干净的词典条目,音高重音解析就会变难。因此 akusento 一直在用长篇小说文本做压力测试——在那里,复合词、人名、假名写法、助词、后缀和有歧义的读音都会自然出现。
基准数据是怎么采集的
当前的生产基准,正在用 村上春樹『ねじまき鳥クロニクル』第3部 中真实、未经筛选的散文持续审核。评估采用刻意从严的标准:akusento 的输出会逐拍与专业有声书朗读对照。只要出现音高、读音、分块或语境上的疑似偏差,就会停下来分析、查证。只有反映系统性解析器问题的偏差,才会记为引擎错误。
每一条记录在案的错误,都会归入具体而细致的失败分类,例如复合规则、词性、边界分块或语境同音词。这种结构化的透明度构成了一个具体的算法调试闭环,可以把词库查询的局限与真正的语境运行时错误区分开。
- 57 复合词问题
- 47 音高问题
- 31 分块问题
- 21 语境同音词
- 16 读音问题
- 7 词性问题
为避免准确率被人为抬高,这一估算会用动态算出的每词 2.37 个字符这一指标,把错误之间的原始字符间隔换算回词数。该数值直接取自审核文本,并严格排除了单个平假名的语法助词(は、が、に 等)和标点。因此,这项基准只衡量引擎在核心内容词上的表现,例如复杂复合词、活用动词和专有名词。
在这样严格的评估下,解析器平均要连续走过约 658 个字符(大致相当于 19 个连续的文学句子)才会出一次错。作者个人的非标准表记会被单独标出,并系统性地从这些核心评估指标中剔除。
出于版权原因,公开版报告已移除句子语境。
这些数字到底意味着什么: 这项基准是在真实文学文本上做的一次内部人工审核,属于开发过程中的评测,并不是说任何输入都能达到 99.64% 的正确率。之所以公开,是因为透明很重要:错误被逐一计数、分类,并用来改进解析器。
输出要可读,但不掩盖背后的复杂性。
语境优先于查词
词典很有用,但日语并不是以孤立词条的形式说出来的。akusento 围绕句子语境构建:前面是什么、后面接什么,以及语法如何改变重音的形态。
规则可解释
解析器每应用一条句子级规则,前端都会把这个判断展示出来。这让 akusento 不只是一台给出确定答案的机器,也是一个可以边用边学的地方。
真实世界里的边缘情况
规则系统是被真实的失败塑造出来的:有歧义的读音、助数词表达、词汇音高单元合并、后缀行为、去重音连锁、动词与名词的歧义,以及语法边界附近的标点。
标准东京日语
akusento 专注于标准东京式的音高重音。专有名词、方言形式、罕见的文学表达和作者自创的写法仍然可能很棘手,但每一条记录下来的错误,都会变成一条具体的改进路径。
研究预览
akusento 目前是一个正在积极开发中的研究预览。公开网站包含文档、缓存的解析示例和界面的静态预览;实时解析器后端在测试期间仍不对外开放。
开发重点是扩大重音规则的覆盖面,提升解析器准确率、评估方法和输出的可解释性。等解析器成熟到可以更广泛使用时,我们计划开放后端。
如果你正在学日语、在教音高重音、在做日语相关的工具,或者对解析器的技术细节感兴趣,我们特别欢迎你在这个封闭预览期间提供反馈。
想试用 akusento 或分享反馈? 联系 hello@akusento.com.