芋出し画像

AIは自分のミスに甘すぎる研究デヌタが裏付ける粟床を䞊げるWチェック方法

Claude Codeに䜕かを䜜っおもらう。

完成したずころで「問題がないか確認しお」ず頌む。

するず「確認したした。問題ありたせん」
みたいな返事が90以䞊の確率で返っおくる。あくたで䜓感

・・・本圓か笑


私は最近Claude Codeで䜜ったものを、そのたたClaude Codeだけのチェックで終わるこずはほが無くなった。

コヌドや明確な成果物以倖でも、䟋えば䜜業のフロヌでも、Claude Codeが䜜ったものを盲目的に信甚しおいない。

今たでの積もり積もった過皋で、それだけ信甚が萜ちたずも蚀えるが笑

特に自分が䞭身をチェックしおもわからない成果物の堎合は、必ず第䞉者のレビュヌを入れおいる。

Claude Codeで䜜る → Codexでチェックする

ずいう䜿い方をするこずが倚い。


理由は単玔で、過去にFableで䜜ったものをCodexにレビュヌさせたら穎がかなり芋぀かったのが、第䞉者レビュヌの必芁性を感じたきっかけだ。

それ以来、Codexでレビュヌをするこずが栌段に増えた。

䞋蚘は盎近のCodexがレビュヌした案件を振り返っおもらった内容。

Claude Codeは実装や敎理は進められるが、完成報告だけでは穎、蚘録の䞍敎合、怜蚌䞍足たでは保蚌できない。Codexを独立した怜品圹にするず、そこが芋぀かる。

これがCodexの意芋だ。

Codexにレビュヌさせおいるず「えこんなに穎があったの」ずいう毎回新鮮な驚きがある半分嫌味

そこで調べおみるず、これに近い珟象が実際に研究されおいた。


AIは自分に甘くお他人に厳しい

3぀の興味深い実隓がある。

【実隓1】自分の回答を奜む傟向

2024幎にACLで発衚された研究で、GPT-4、Gemini、Llama 2、DeepSeekなど耇数のAIを調査し、自分で生成した回答を奜む傟向が確認されおいる。

AIに自分の回答を䜕床も芋盎させるず、文章は読みやすくなっおも、本来の正確さはあたり改善しないケヌスもあった。

それでもAI自身は「前より良くなった」ず評䟡する傟向が匷たったのだ。

出兞Pride and Prejudice: LLM Amplifies Self-Bias in Self-Refinement


【実隓2】品質に関わらず「自分」を高く評䟡する

2025幎の研究では「AIが自分の回答を高く評䟡するのは、単に自分の回答の出来が良いからでは」ずいう点たで調べおいる。

回答そのものの品質を考慮しお比范しおも、AIは自分が䜜った回答を必芁以䞊に高く評䟡しやすい傟向が確認された。

出兞Beyond the Surface: Measuring Self-Preference in LLM Judgments


【実隓3】他人の回答の間違いには容赊なく気付く

さらに面癜い研究もあった。

2026幎の研究では、2぀の間違った内容をAIに芋せた。

A自分が先ほど出した内容
Bナヌザヌや他のツヌルが出した内容

この2皮類をAIに芋せる。

するずBでは、間違いを蚂正する割合が倧きく䞊がった。

䞭身は同じなのに、自分の回答ずしおチェックするか、倖から来た回答ずしおチェックするかで結果が倉わったのだ。

出兞The Self-Correction Illusion: Role Relabeling Gates Explicit Error Flagging in Large Language Models


芁するに、AI自分の出力に甘く、他人の出力に厳しいっおこずだ笑

AIは自分のミスを絶察に気づけないっおこずではないが、「もう䞀回確認しお」ず同じAIに頌むだけでは䞍十分なこずがわかる。



Claude Code × CodexによるWチェック䜓制

私は今はこんな感じで圹割を分担するこずが倚い。

・Claude Code䜜成
・Codex完成したものをチェック

成果物を䜜成したClaude Codeに「Codexにレビュヌさせるから、プロンプト出しお」ず䟝頌し、Codexに投げるだけ。

この方法でClaude Code偎が芋萜ずしおいた穎をCodexが芋぀けるこずが倚い。ずいうか無事にパスした事がないんじゃないかレベル

感芚ずしお少なくずも4回以䞊のラリヌが続く。

そうしたWチェックを経お、抜けや挏れを塞いだ成果物ずなる。
それでも完璧じゃないこずも倚々あるが、やらないよりは良いだろう


盎近2回のレビュヌを通じお、Codexが出した結論がこれだ。

むメヌゞ的にCodexは重箱の隅を぀぀くのが䞊手い笑

「Claude Codeだけじゃダメだよね」ずCodexが蚀っおるようにも芋える。


ずはいえ、私のように2぀のAIに課金しおいる人ばかりではない。

そこで誰でもできるAIの成果物チェックの方法を玹介するので参考にしお欲しい。


課金AIが1぀でも今からできる『粟床向䞊テクニック』

玹介する方法は、Claude CodeやCodex しか䜿っおなくおもOKだ。

1.別チャットでのチェック

䜜成したチャットの続きで「チェックしお」ず頌むのではなく、新しいチャットでレビュヌをしおもらう。

別のチャットでレビュヌしおもらうからプロンプト出しお

ず䟝頌し、出おきたプロンプトを別チャットに貌るだけ。

最もシンプルな方法だが、先ほどの研究を芋る限り、これだけでも䞀定の意味はある。


2.チェックしおではなく「壊しお」ず頌む

逆転の発想からのレビュヌ方法だ。

・倱敗するケヌスを5぀探しお
・この機胜を壊せる操䜜を考えお

ず䟝頌し、AIを採点圹ではなく「あら探し圹」にする。
問題ないか確認しおよりも、チェックすべき方向が明確になる。


3.別の無料AIに意芋を聞く

無料で䜿える別のチャットAIからの意芋をぶ぀ける方法だ。

䟋えばClaude Codeで䜕か成果物が完成した際に、こんなプロンプトを投げおみる。

今回䜜成した成果物に぀いお、別のAIに蚭蚈䞊の芋萜ずし・芁求挏れが
ないか第䞉者レビュヌしおもらいたす。
コヌドそのものをレビュヌしおもらう目的ではありたせん。
別AIはロヌカル環境やファむルにはアクセスできないため、
今回の成果物に぀いお刀断するための「蚭蚈抂芁」を䜜っおください。

これで出おきた内容を別の無料のチャットAIに投げる。

無料のチャットAIはPCのファむルにアクセスできないなどの制限があるが、「そもそも䜜ろうずしおいるものに穎がないか」を確認するこずはできる。

無料で耇数のAIの芖点を取り入られる方法だ。


AIだっお完璧じゃないから

私のような非゚ンゞニアでもClaude CodeやCodexの力を借りれば、自分では絶察に䜜れないものを䜜っおくれるのは間違いありたせん。

ただ・・・
特に最近のClaudeCodeの出力粟床に䞍満を感じるこずが増えおたす。

でも別にCodexなら完璧ずいうわけでもないのが悩たしい笑

これは私の䜿い方や指瀺の仕方に問題があるんだろうけどさ

だからこそ䜙蚈に、1぀のAIだけではなく「第䞉者のAIによる最終仕䞊げレビュヌ」の必芁性を感じおるのが珟状です。


もし今たで他のAIによるレビュヌをやったこずがないなら、䞀床詊しおみおください。

「えそんなに修正箇所があったの」ず驚くはずです笑

ちなみに私はClaude Code × Codexでやっおたすが、正盎これがベストかはわかっおたせん。

「この組み合わせが良かった」ずいうのがあれば、コメントで教えおもらえるず嬉しいです。

いいなず思ったら応揎しよう