AIに文章やレポートを作らせると、たいてい上手くいく。しかし細部を見ると、なぜか一箇所だけロジックが崩れていることがある。完全な破綻ではなく、ほぼ正しいのに一部だけおかしい、という程度のずれである。

この違和感を出発点に、(1)機械学習の文献、(2)人間の脳科学の文献、の両面から調べた。そのうえで得られた知見をもとに検証用のスキルを設計し、実際に5パターンのテストで動作を確かめた。この記事はその一連の記録である。


第1部:LLM側の文献調査

まず、この現象について機械学習の研究で何が分かっているかを、7本の論文を実際に読んで確認した。

AIは「推論」ではなく「記憶の切り貼り」で答えている

Faith and Fate(Dziri et al., NeurIPS 2023)は、AIに多桁の掛け算や論理パズルを解かせ、答えに至る途中の過程を分析した研究である。未見の問題で最終的な答えが正解だったケースのうち、**82.3%**で少なくとも1つの中間計算に誤りが含まれていた。つまり「正しい答え」は、正しい手順の産物ではなく、訓練データで見た断片的なパターンがたまたま辻褄を合わせた結果であることが多い。

AIの「説明」は、後から作られたもっともらしいストーリーであることが多い

前段で見た「答えは合っているが過程は間違っている」という現象は、もう一つの疑問につながる。AIが答えと一緒に述べる「理由」や「考え方」は、本当にその判断の根拠になっているのだろうか。

Language Models Don’t Always Say What They Think(Turpin et al., 2023)は、選択肢の並び順などにAIの判断を密かに誘導する実験を行った。バイアスの影響で誤答した426件のうち、その要因に言及した説明はわずか1件だった。

Measuring Faithfulness in Chain-of-Thought Reasoning(Lanham et al., Anthropic, 2023)はさらに踏み込み、AIの「考えながら答える」文章(Chain-of-Thought=答えを出す前に途中の思考過程を言葉にして書き出させる手法)が、実際の判断根拠になっているかを検証した。8タスク中7タスクで、小さいモデルの方が大きいモデルより正直という結果が出ている。モデルが賢くなるほど、後付けの説明が上手くなるという構図である。

On the Biology of a Large Language Model(Anthropic, 2025)は、モデルの内部を直接観測する技術で、この乖離を実証した。「36+59は?」という暗算をAIにやらせると、「一の位を足して繰り上げる」という教科書通りの説明を書くが、実際に使っていた計算は大雑把などんぶり勘定と暗記パターンの組み合わせで、説明とは別物だった。

対策として効果が確認されている手法

ここまでの3本は「問題がどこにあるか」を示す研究だった。ここからは「では、どう防げるか」を調べた論文を見ていく。

Chain-of-Verification(Dhuliawala et al., 2023、=最初の回答を見せない独立した状態で検証用の質問に答えさせる手法)は、長文の事実正確性を55.9%から71.4%まで改善させた。NCV(2025、=文章全体を一度に判定せず、主張を細かい単位に分解してから個別に検証する手法)は、誤り位置の特定精度を25.3%から55.8%に倍増させつつ、処理コストを最大57.6倍削減した。

一方で When Can LLMs Actually Correct Their Own Mistakes?(Kamoi et al., TACL 2024)は、これまで「自己修正が効いた」とされてきた研究の多くを検証し直し、「外部の手がかりが一切ない状態で、AIに自分の書いたものを見直させて改善した信頼できる例は存在しない」と結論している。効くのは「独立した検証」や「分解してからの検証」であって、「同じ状態のまま振り返らせること」自体には効果がない、ということになる。

詳細な論文別レビューは社内の調査ノートに記録している。


第2部:人間の脳科学から言えること

ここまでの調査で分かったのは、LLMが「一貫した推論」ではなく「断片のつなぎ合わせ」で答えを出しており、しかもその説明はしばしば後付けである、という点だった。これはAI特有の欠陥なのか、それとも人間の知能にも似た構造があるのか。この疑問を確かめるため、人間の脳、特に左右の半球がどう連携しているかの研究に目を向けた。左右の脳がお互いの論理性をチェックし合っているのであれば、それはAIの検証手法を考える上でもヒントになるはずである。中心に据えたのは、Michael Gazzanigaによる分離脳(split-brain、=左右の脳をつなぐ神経を外科的に切断した患者を対象にした研究)で、関連する7本の論文を読んだ。

「相互チェック」ではなく「非対称な分業」

The Left Hemisphere’s Role in Hypothesis Formation(Wolford, Miller & Gazzaniga, 2000)では、確率的なランプの点灯を予測させる課題で、右半球は統計的に最適な戦略を取るのに対し、左半球はランダムな系列にパターンを見出そうとして非効率な戦略を取ることが分かった。

ただし Probability matching in the right hemisphere(Miller & Valsangkar-Smyth, 2005)は、顔刺激(右半球が優位に処理する対象)を使うとこの役割が逆転することを示している。「左脳=非合理、右脳=合理的」という単純な図式自体が、刺激の種類に依存するということである。

作話(confabulation)が示すもの

もう一つ注目したのが、分離脳患者に見られる「作話(confabulation)」という現象である。これは、本人に嘘をついている自覚がないまま、もっともらしい説明を無意識に作り出してしまうことを指す。古典的な観察例では、右半球にだけ見せた指示で行動した患者に理由を尋ねると、その指示を認識していない左半球が、真の理由を知らないまま即座にもっともらしい説明をでっち上げる(Gazzaniga, 2000; 2005)。有名な例では、右半球に雪景色を見せられ左手でシャベルを選んだ患者が、「鶏小屋の掃除のため」と全く無関係な理由を作った。

7本を通読した結論として、「相互チェックがうまく機能している」ことを直接支持する証拠は見当たらなかった。あるのは「情報共有が断たれると、一方の半球が他方の情報を欠いたまま自己完結的な誤った説明を作ってしまう」という、より受動的な構図である。これは第1部で見たLLMの後付け説明と、驚くほど似た形をしている。つまり両者に共通するのは「複数の視点が互いを積極的に監視している」というモデルではなく、「一方が他方の情報を持たないまま、単独でもっともらしい話を完結させてしまう」という失敗のパターンだった。

詳細は社内の調査ノート(hemisphere-mutual-check-report.md)に記録している。


第3部:検証スキルを作る

第1部・第2部を通して見えてきたのは、「一つの主体に丸ごと任せて、同じ状態のまま振り返らせる」という素朴なやり方では、機械学習の知見に照らしても、脳科学の知見に照らしても、誤りを防ぐ根拠にならないという点だった。そこで、実際に使えるチェックの手順に落とし込むため、次の設計方針を立てた。

  • 同じ文脈での自己レビューは効かない(Kamoi et al.の知見)
  • 文書全体を一度に見るのではなく、主張を分解して個別に検証する方が精度が高い(NCVの知見)
  • 「同じ機能を持つ主体を2つ並べる」のではなく、異なる役割・異なる情報アクセスを持たせる方が良い(脳科学の分業の知見)

この方針で、Claude Codeの個人用スキルとして fresh-eyes-verify を作成した。文書を主張単位に分解し、元の文書の結論を見せない独立したエージェントに、一次資料と照合させて検証させる、という手順である。


第4部:実際にテストしてみたら、仮説の一部が崩れた

第3部の設計方針は、あくまで文献から導いた仮説にすぎない。実際にこの手順が効果を持つのかを確かめるため、意図的に誤りを仕込んだテスト文書を用意し、5パターンの比較を行った。

テスト1・2:ファクトチェック型の誤り

架空の業績レポートに、数値の誤流用や、相関と因果の混同(マーケティング施策の効果を、価格変動という別の要因を無視して主張する等)を仕込んだ。

結果、「スキル通りの分解・独立検証」と「素朴に新しいエージェントへレビューを依頼するだけ」の間に、有意な差が出なかった。両方とも仕込んだ誤りを正確に検出した。一方、同じ会話の中で自分の書いたレポートを振り返る自己レビューでは、すべての問題を見逃した。

ここで立ち止まって考え直した。テスト1・2で仕込んだ誤り——数値の誤流用や、相関と因果の混同——は、いずれも「元になった正しいデータや事実と照合すれば見抜ける」種類の誤りである。しかし、この記事の出発点にあった問題意識は、そもそも元データが存在しない、長い文章そのものの中で論理が微妙にずれていくケースだった。つまりテスト1・2は、知らないうちに「ファクトチェックの精度」という、当初の問いとは似て非なる問題を検証してしまっていたことになる。そこでテスト3以降は、外部の正解データに頼らず、文章内部の前提だけから正誤を判定できる誤りに絞って設計し直した。

テスト3:元データのない、純粋な論理のずれ

前提条件だけが書かれた自己完結的な文章(発注点=在庫がこの水準まで減ったら次の注文を出す、という基準値の計算ロジック)に、統計的にありがちな誤りを1つ仕込んだ。本来は標準偏差を期間の長さの平方根で積み上げるべきところを、期間の長さでそのまま倍にしてしまう、というものである。この場合も、素朴なレビューと、前提から独立に再計算させる方式の両方が、誤りを検出した。

テスト4:長い文書に埋め込まれた、離れた矛盾

さらに難易度を上げ、5つのセクションからなる文書の冒頭で「週あたり0.5%」と定義した数値を、数段落離れた箇所で単位を変換せずに「月間の計算」に再利用する、という矛盾を仕込んだ。

ここでも両方の方式が矛盾を検出したが、踏み込み方に明確な差が出た。素朴なレビューは矛盾に気づいたものの、「マージンが思ったより薄い」と付け加えるだけで、元の結論(サーバー2台で十分)の方向性は維持した。これに対し、「矛盾が見つかったら、そこで止めずに正しい値で最後まで再計算し、結論が今も成り立つか判定する」よう明示的に指示したエージェントは、実際に結論を訂正した(2台では安全マージンがほぼ残らず、3台構成の方が実質的に意味のある改善である、という逆の結論に至った)。

分かったこと

誤りに気づけるか気づいた誤りを結論まで正しく反映できるか
同一文脈の自己レビューできない—
フレッシュな文脈での素朴なレビューできる元の結論に引きずられがち
独立した再計算・機械的な突き合わせできる結論まで正しく訂正できる

当初の仮説(「主張の分解」や「役割分担」そのものが効く)は、少なくとも今回試した規模の文書では、部分的にしか支持されなかった。**決定的だったのは「同じ文脈で振り返らないこと」であり、それに加えて効いていたのは「矛盾を見つけて終わりにせず、最後の結論まで実際に再計算させること」**だった。当初の設計は、検証されていない部分を過大に見積もっていたことになる。

この結果を受けて、スキルの手順をこの2点に絞って書き直した。


まとめ

  • AIが書く長い文章に混ざる局所的な論理のずれは、機械学習の研究(LLMは一貫した推論過程を持たず、断片的なパターンをつなぎ合わせている)と、人間の脳科学の研究(左右の半球は相互チェックではなく非対称な分業をしており、情報共有が断たれると片方が作話する)の両方から、構造的に理解できる。
  • これを防ぐ具体的な手段として、文献上は「同じ文脈での自己レビューをやめる」ことが最も重要とされていたが、実際にスキルとして作って検証してみると、その通りだった。
  • 一方で、文献をもとに独自に加えた「主張の分解」「役割分担」という工夫は、テストした範囲では検出力そのものへの明確な上乗せを確認できず、代わりに「矛盾を見つけた後、結論まで正しく再計算させる」ことの方が、実際には重要だった。

理屈から組んだ設計が、実地のテストで一部裏切られる——これもまた、この記事のテーマ(もっともらしい説明と、実際に機能する仕組みは別物である)を自ら証明する結果になった。


本調査はClaude Code上のサブエージェントによる文献の実読(各論文をWebFetchで取得)と、5パターンの比較実験による。スキル本体・検証記録は社内リポジトリで管理している。