日本語 decision model ベンチマーク

総合指数

各タスクの skill の平均です。skill は Decision Index と同じく chance で正規化した値で、0 がランダム、100 が全問正解です。受け付けない形式のタスクは 0 として数えます。

モデル別の指数(0〜100)
  • span-01 lite32.0

タスク別のスコア

test 分割の skill(0〜100)です。正解率そのもの(raw)は下の全数値の表にあります。Noul のタスクの raw は「はい」と「いいえ」それぞれの正解率の平均(balanced accuracy)です。* は Choice を受け付けないモデルで、選択肢ごとに Noul で聞き「はい」の確率が最も高いものを答えにしています。

JNLI 含意関係(Choice) の skill
  • span-01 lite*23.1
業務ルール判定(Noul) の skill
  • span-01 lite40.9

対応形式と失敗率

未対応は、モデルがその形式(Choice / Noul)の問いを受け付けなかったものです。失敗は、受け付けたうえでエラーや形式違いの答えが返った割合です。

モデルJNLI 含意関係(Choice)業務ルール判定(Noul)
span-01 liteNoul 分割・失敗 0.0%失敗 0.0%

レイテンシ

OpenRouter 経由で 1 件を判定するのにかかった時間の中央値(p50)です。棒の長さは全タスク共通の目盛りです。

JNLI 含意関係(Choice) の p50
  • span-01 lite*186 ms
業務ルール判定(Noul) の p50
  • span-01 lite198 ms

全数値

グラフの元になった数値です。費用は OpenRouter が返した実費(USD)です。

JNLI 含意関係(Choice)
モデルskillraw失敗率p50 / p95 ms1,000 件あたり
span-01 lite*23.148.80.0%186 / 335$0.0000
業務ルール判定(Noul)
モデルskillraw失敗率p50 / p95 ms1,000 件あたり
span-01 lite40.970.40.0%198 / 361$0.0000

正解ラベル

正解ラベルの件数と、Opus 5.5 でラベルを付けたときの費用です。

タスク件数hardOpus 5.5 のラベル費用Opus 5.5 と人の正解の一致率
jnli243410$6.691591.5%
rules5002$22.2231-