日本語 decision model ベンチマーク
- 正解ラベルは Claude Opus 5.5 だけで付けました(JNLI は人の正解を使い、Opus 5.5 のラベルは誤り率の目安にだけ使っています)。
- スコアは Opus 5.5 のラベルとの一致率で、本当の正しさではありません。
- 勉強目的の実験なので、結果を過信しないでください。
総合指数
各タスクの skill の平均です。skill は Decision Index と同じく chance で正規化した値で、0 がランダム、100 が全問正解です。受け付けない形式のタスクは 0 として数えます。
- span-01 lite32.0
タスク別のスコア
test 分割の skill(0〜100)です。正解率そのもの(raw)は下の全数値の表にあります。Noul のタスクの raw は「はい」と「いいえ」それぞれの正解率の平均(balanced accuracy)です。* は Choice を受け付けないモデルで、選択肢ごとに Noul で聞き「はい」の確率が最も高いものを答えにしています。
- span-01 lite*23.1
- span-01 lite40.9
対応形式と失敗率
未対応は、モデルがその形式(Choice / Noul)の問いを受け付けなかったものです。失敗は、受け付けたうえでエラーや形式違いの答えが返った割合です。
| モデル | JNLI 含意関係(Choice) | 業務ルール判定(Noul) |
|---|---|---|
| span-01 lite | Noul 分割・失敗 0.0% | 失敗 0.0% |
レイテンシ
OpenRouter 経由で 1 件を判定するのにかかった時間の中央値(p50)です。棒の長さは全タスク共通の目盛りです。
- span-01 lite*186 ms
- span-01 lite198 ms
全数値
グラフの元になった数値です。費用は OpenRouter が返した実費(USD)です。
| モデル | skill | raw | 失敗率 | p50 / p95 ms | 1,000 件あたり |
|---|---|---|---|---|---|
| span-01 lite* | 23.1 | 48.8 | 0.0% | 186 / 335 | $0.0000 |
| モデル | skill | raw | 失敗率 | p50 / p95 ms | 1,000 件あたり |
|---|---|---|---|---|---|
| span-01 lite | 40.9 | 70.4 | 0.0% | 198 / 361 | $0.0000 |
正解ラベル
正解ラベルの件数と、Opus 5.5 でラベルを付けたときの費用です。
| タスク | 件数 | hard | Opus 5.5 のラベル費用 | Opus 5.5 と人の正解の一致率 |
|---|---|---|---|---|
| jnli | 2434 | 10 | $6.6915 | 91.5% |
| rules | 500 | 2 | $22.2231 | - |