AIの草稿を採点するとき、数値の確認には二つの種類がある。

一つは、草稿に書かれた数値が事実ソースと一致するかを見る「転記の照合」。もう一つは、複数の数値を並べたときに経過の勘定が合うかを見る「整合の照合」だ。

今回の採点では、親の採点者が転記の照合だけを通し、整合の照合を見落とした。草稿に登場する数値はソースに存在していたため、個別に突き合わせる検査では誤りが見えなかった。その後、独立した別モデルによるクロス採点が勘定のずれを指摘した。

重要だったのは、別モデルが正解したことだけではない。判定が割れた場合の決め方を草稿の確認前に固定していたため、土台となる草稿を変更しても、出力を見た後の恣意的な基準変更にならなかった。

同じ依頼から作った複数の草稿を3段階で採点する

この事例で使われていたのは、同一の依頼文を複数のAIモデルへ独立に渡し、返ってきた草稿を採点して1本の記事へ統合する体制だった。各モデルには互いの出力を見せていない。この体制を組んだ経緯は同じ調査を4つのAIに投げた記録で扱っている。

採点でいう「混入」とは、渡した事実ソースにない記述や、言い換えによって元の意味が変わった記述が草稿に入り込むことを指す。

採点手順は、草稿を読む前に次の3段階で事前登録されていた。

  1. 事実照合として、数値・固有名詞・条件をソースと突き合わせ、混入を列挙する
  2. ブリーフで禁止した6項目を一つずつ○×で確認する
  3. 記事として成立している方を土台に選び、理由を3行で残す

ここでの事前登録とは、採点手順と土台決定ルールを、草稿を読む前に文字で固定し、読んだ後は変更しないことだ。出力を見てから基準を足したり緩めたりすると、結果を後付けで説明できてしまい、比較そのものが成立しなくなる。

クロス採点が動く条件も先に決めてあった。親の事実照合で両稿とも混入ゼロだった場合に限り、別モデルが同じ3段階で独立に評価する。混入が見つかれば土台は事実照合で決まり、全体感による主観的な比較へ進む必要がない、という設計だった。

親の照合では両稿とも「混入ゼロ」だった

採点対象の記事は、Google Trendsで需要を測定した際、24語中20語が0に張り付いた事例を扱っていた。

測定の経過は次のとおりだった。

段階0だった語
初回測定20語
全語をヘッド語へ変更した後5語
接続点を使った補助測定後0語

初回は「花 定期便」「出張撮影 料金」のような複合語を候補にし、共通のアンカーには「ゴルフ」という1語を置いていた。測定する語の粒度をヘッド語へ揃えて再測定しても、通常バッチでは5語が平均0のまま残った。

そこで、ゴルフ比1.23のWiMAXを接続点にして補助バッチを組んだ。その結果、フードデリバリー0.53、知育玩具0.37、古着買取0.36、オプショナルツアー0.29、出張撮影0.13という実測比率が得られ、0の語はなくなった。

親の採点者は二つの草稿について「混入ゼロ」と判定した。24語中20語、ヘッド語化後の5語、補助測定後の0語を含め、草稿に登場する数値はソースの記載と一致していた。転記の照合としては、数値を正しく確認できていた。

この判定により、事前登録された条件を満たし、クロス採点が発動した。

クロス採点が「20語」の使われ方を問題にした

クロス採点者のcodexは、claude-subagent稿に3件の混入を指摘した。決定打となったのは、終盤にあった次の内容だった。

0だった語のうち20語はヘッド語へ直すだけで値が付き

「20語」という数値自体は、初回に0だった語数としてソースに記載されている。しかし、経過全体と合わせると勘定が合わない。

初回に0だったのは20語。その後、ヘッド語へ直しても5語が0のまま残った。したがって、ヘッド語化だけで値が付いたのは15語である。残りの5語はWiMAXを接続点にした補助測定で解像している。

つまり、問題は数値の書き写しではなく、数値が説明する範囲の変化だった。「初回に0だった20語」が「ヘッド語化だけで値が付いた20語」へ置き換わっていた。ソースにある数字を使っていても、意味が変われば混入になる。

ほかの2件は、「ロングテールはヘッド語の部分集合」「検索者の一部」というソース外の断定と、「表示可能な比率に届かなかった」という閾値的な挙動の説明だった。前者の指摘は成立し、後者は部分的に成立した。「最大値を100とする指数」という前提まではブリーフにあったが、閾値の挙動までは事実ソースの範囲外だった。

転記の照合と整合の照合は別の検査だった

親が見落とした原因は、照合を一種類の作業として扱っていたことにある。

転記の照合

転記の照合では、草稿中の数値・固有名詞・条件をソースから探し、一致しているかを確認する。

今回の「20語」はソースにあり、「5語」も「0語」もソースにあった。この見方では、個々の数値は正しい。

整合の照合

整合の照合では、複数の数値が同じ経過の中で両立するかを確認する。

今回なら、次の勘定を一続きで見る必要があった。

  • 初回に0だった20語
  • ヘッド語化後も0だった5語
  • ヘッド語化だけで解像したのは20から5を引いた15語
  • 残る5語が補助測定で解像し、最終的に0語

この確認を通せば、「20語はヘッド語へ直すだけで値が付いた」という記述は成立しない。親の照合は、数値を一つずつソースへ戻すところで止まり、数値どうしの関係までは検査していなかった。

事前登録が土台変更の根拠になった

クロス採点後、親は指摘をそのまま採用したのではなく、根拠を一次ソースで検証した。その結果、数の不整合を認め、1往復で判定が収束した。

土台は当初のclaude-subagent稿からcodex稿へ変更された。これはクロス採点者の好みを優先した変更ではない。事前登録していた「混入があれば土台は照合で決まる」というルールを適用した結果だった。

このルールが草稿を読んだ後に決められていたら、同じ結論でも意味が変わる。「自分の判定が否定されたので、否定された側が負ける規則を後から採用した」と説明できてしまうからである。順序が先だったので、土台の変更が恣意にならなかった。

客観的な事実不整合が決定打だったため、人間による裁定であるuser gateも必要なかった。

誤った記述は統合稿に含めず、claude-subagent稿からは、誤りのない図・言語化・確認手順だけを接いだ。codex稿も「ヘッド語化だけで解像したのは15語」という勘定を明示していたわけではなく、その説明自体を避けていた。誤らなかったのではなく、書かなかったのである。さらに、一次記録にも「15」という数値は直接書かれていなかった。

このため、経過の数を草稿に明示させたいなら、「初回20語が0、ヘッド語化後も5語が0、ヘッド語化だけで解像したのは15語」とブリーフ側に勘定まで書く必要がある、という反映材料も残った。

この1回の事例から体制へ戻せる3点

今回の結果は、特定モデルの優劣を示すものではない。親とクロス採点者の役割が逆なら、見落とす側も指摘する側も逆になり得る。確認できたのは、独立した採点経路が、親自身の照合漏れを実際に1件捕まえたという範囲までだ。

この事例から採点体制へ戻せるのは、次の3点である。

  1. 事実照合を「転記」と「整合」に分ける
    数値がソースに存在するかだけでなく、前後の数値と勘定が合うかを別項目として確認する。

  2. 採点者を一つの経路に閉じない
    クロスチェックは主観的な評価の偏りだけでなく、最初の採点者が見落とした事実不整合にも働く場合がある。

  3. 判定が割れたときの決め方を先に書く
    混入があれば事実照合を優先するなど、土台決定ルールを出力を見る前に固定する。

数値を正しく書き写していても、数値の関係まで正しいとは限らない。今回すり抜けたのは、20、5、0という数字ではなく、その間にある勘定だった。