日本語の複雑な現実に向き合うパーサー。

akusentoは、辞書検索に見た目のよいUIを被せただけのものではありません。活用され、複合され、助詞が付き、句読点で区切られ、例外に満ちた、実際の文中の日本語を扱うための文脈対応ピッチアクセントパーサーです。

日本語の原文から読めるピッチアクセントへ。

このシステムは、確立された形態素解析、語彙ピッチトークンの結合、独自のルールエンジンを組み合わせています。目標は単純に聞こえます。難しく抽象的なピッチアクセント情報を、学習者がそのまま読める形に変換すること。その際、解析結果を導いた適用ルールや文法上の判断は隠しません。

01

文をトークン化

入力文はMeCabとUniDicによって単語オブジェクトへ分割されます。各トークンは、表層形、見出し語、読み、品詞、活用情報、下がり目候補、文法メタデータなど、後続の判断に必要な情報を持ちます。

02

ピッチトークンを結合

辞書や結合器の検索によって、隣接する形態素トークンが一つのアクセント句として振る舞うと分かった場合、それらはより大きなピッチ単位に結合されます。

03

文脈ルールを適用

語彙ピッチトークンを結合した後、文単位のルールエンジンが接尾辞アクセント、助詞、助動詞、活用、複合語、文法境界、既知の例外を処理し、文脈内でアクセントがどう振る舞うかを決定します。

04

結果を表示

解析済みのデータは構造化された出力としてフロントエンドに返され、読みやすい日本語として表示されます。ふりがな、下がり目のマーク、無声化マーク、色分けされた型の分類、そして適用されたルールのクリック可能な説明が付きます。

入力
トークン化
結合 語彙ピッチトークン検索 形態素トークン 表層一致 検索 下がり目 = 5 結果 結合済みピッチトークン
ルール 文単位ピッチルール 接尾辞ルール 非結合ルール 平板、下がり目 = 0 直前の語 文脈上の下がり目 = 0 条件 直前の語が平板 真 結果
JSON { html, json_data, pitch_accents, applied_rules }
出力

人工的な例ではなく、実際の文章で測定。

入力がきれいな辞書見出し語ではなくなると、ピッチアクセント解析は難しくなります。そのためakusentoは、複合語、人名、かな表記、助詞、接尾辞、曖昧な読みが自然に現れる長編小説本文で継続的にストレステストされています。

99.64% 推定内容語トークン精度
179 記録された修正
118,861 確認済み文字数
~19 無エラーで続く平均文数

ベンチマークの収集方法

現在の本番ベンチマークは、の実際の未加工本文に対して継続的に監査されています。評価基準は意図的に厳格です。akusentoの出力をプロ朗読オーディオブックとモーラ単位で照合し、ピッチ、読み、区切り、文脈上のずれが見つかるたびに停止して分析・調査します。体系的なパーサー問題を反映するずれだけをエンジンエラーとして記録します。

記録された各エラーは、複合ルール、品詞、境界の区切り、文脈依存の同音異義語など、非常に細かい失敗分類に切り分けられます。この構造的な透明性によって、辞書引きの限界と、実行時の文脈判断による失敗とを分離できる、具体的なデバッグのループが回ります。

  • 57 複合語の問題
  • 47 ピッチの問題
  • 31 区切りの問題
  • 21 文脈依存の同音異義語
  • 16 読みの問題
  • 7 品詞の問題

精度スコアが不当に高く出ないように、この推定ではエラーとエラーの間の素の文字数を、動的に算出した1トークンあたり2.37文字という値で単語数に換算しています。この値は監査対象のテキストから直接求めたもので、などの一文字のひらがな助詞と句読点は厳密に除外しています。そのためこのベンチマークは、複雑な複合語、活用する動詞、固有名詞といった中核的な内容語に対するエンジンの性能だけを測っています。

この厳格な評価のもとでも、パーサーが誤りを1つ出すまでに平均で約658文字(文学作品の文にしておよそ19文連続)はエラーが出ません。標準的でない作者独自の表記の揺れは個別にフラグを立て、これらの中核指標からは体系的に切り離しています。

著作権上の理由により、公開レポートからは文脈本文を削除しています。

これらの数値が実際に意味すること: このベンチマークは、実際の文学テキストを対象に開発中に手作業で監査した内部測定であり、どんな入力でも99.64%正しいという普遍的な主張ではありません。透明性が重要だと考えるからこそ公開しています。エラーは数え、分類し、パーサーの改善に使っています。

複雑さを隠さず、読める出力へ。

検索より文脈

辞書は役に立ちますが、日本語は見出し語を一つずつ並べて話すものではありません。akusentoは、前に何が来るか、後に何が続くか、文法がアクセントの形をどう変えるかという文脈を中心に設計されています。

説明可能なルール

パーサーが文単位のルールを適用したとき、フロントエンドはその判断を明示します。そのためakusentoは、答えを一つ返すだけの道具ではなく、学びの場としても使えます。

現実に現れる例外

ルールの体系は、実際の失敗から形づくられています。曖昧な読み、助数詞表現、語彙ピッチトークンの結合、接尾辞の挙動、無核化の連鎖、動詞と名詞の区別の曖昧さ、文法境界まわりの句読点などです。

東京式アクセント

akusentoは標準的な東京式ピッチアクセントに特化しています。固有名詞、方言形、まれな文学表現、作家独特の表記は今も難しい場合がありますが、記録された一つ一つのエラーが、具体的な改善の手がかりになります。

研究プレビュー

akusentoは現在、活発に開発中の研究プレビューです。公開サイトにはドキュメント、キャッシュ済み解析例、インターフェースの静的プレビューを掲載していますが、ライブパーサーのバックエンドはテスト期間中は非公開です。

開発では、アクセントルールの網羅性、パーサーの精度、評価方法、説明可能な出力の改善に力を入れています。より広く使える段階になった時点で、バックエンドの一般公開を予定しています。

日本語を学んでいる方、ピッチアクセントを教えている方、日本語のツールに関わっている方、あるいはパーサーの技術的な側面に関心のある方からのご意見を、このクローズドプレビュー期間中はとくに歓迎します。

akusentoのテストやフィードバックに興味がありますか? 連絡先 hello@akusento.com.

ピッチアクセントを練習する ピッチ注釈付きの文学作品を読む ガイドを読む