目次
結論:併用の価値は「速くなる」ではなく「見落としが減る」
Claude CodeとCodexを併用しています。
理由は速度ではありません。1つのAIだけだと、自分の作ったものの間違いに気づけないからです。
この話題を検索すると、開発チーム向けの記事がたくさん出てきます。
役割を分けて実装を速くする、といった内容です。開発チームでなくても、同じことは起きます。ここでは2人の会社の実例で書きます。
開発チームの生産性の話ではなく、コードを書くのが本業ではない小さな会社が、AIの成果物をどう点検しているかという話です。
実際に防いだ事故と、9月に来たばかりの新しいモデルの扱い、そしてやり方を間違えると高くつく課金の話まで書きます。
書いた本人が点検しても、見つかりません
2026年8月、社内の管理ツールを改修しました。
Claude Codeで作り、Claude Code自身に「問題ないか確認して」と頼み、「検証済み」という報告を受け取りました。
念のため、同じコードをCodexに点検させました。
すると検証済みと報告された箇所から、実害のある問題が2件出てきました。
Codexのほうが賢いから見つけた、とは考えていません。
弊社の見立ては「書いた本人が自分をレビューしている」という構造の問題だというものです。人間の仕事でも同じで、自分の書いた文章の誤字は読み飛ばします。
ただしこれは仮説です。同じ条件で比べたわけではないので、モデルの能力差や、指示の書き方の違いが効いた可能性は否定できません。
それでも「別の目を1回通す」だけで実害が2件見つかったという事実は残ります。弊社はこの結果を採って、点検を工程に入れました。
実際に防いだ2件と、実際に使っている指示文
具体的に書きます。どちらも公開前に見つかったので実害は出ていませんが、気づかなければ確実に困っていたものです。
| 見つかったもの | 何が起きるところだったか |
|---|---|
| 設定の取得機能が、パスワードごと返していた | ログインできる人なら誰でも、保存してあるパスワードや外部サービスの鍵を取り出せる状態でした |
| 月々の売上の計算が合っていなかった | 契約が終わったお客様や、まだ始まっていないお客様の分まで足していました。数字を見て経営判断をするところでした |
1件目は情報漏れ、2件目は判断の誤りにつながります。
どちらも「動いている」ので、画面を見ているだけでは絶対に気づきません。指摘されて初めて分かる種類のものです。
そのとき使った指示文
特別なことは書いていません。4つの条件を入れているだけです。
以下のコードを点検してください。
・指摘は必ずファイル名と行番号を示すこと
・推測や一般論は不要。実際に問題が起きる場合だけ挙げること
・各指摘に重大度(重大/中/軽微)を付けること
・ファイルは変更しないこと。読むだけ
特に見てほしい点:認証まわりで、権限のない人に見えてはいけない情報が返っていないか。金額の計算に、対象外のデータが混ざっていないか。
この4つを書かないと、当たり障りのない感想が返ってきます。「全体的によく書けています」で終わると、点検した意味がありません。
最後の「特に見てほしい点」は、毎回その作業に合わせて書き換えます。ここが具体的なほど当たります。
返ってきた6件の内訳
このときCodexが挙げてきたのは6件でした。そのうち直したのは2件だけです。
| 判定 | 件数 | どうしたか |
|---|---|---|
| 実害あり | 2件 | 上の2件。すぐ直した |
| 指摘そのものが間違い | 1件 | 実際に動かして確かめたら、問題は起きなかった |
| こちらの仕様どおり | 1件 | 意図してそうしている部分だった |
| 許容範囲 | 2件 | 理屈としては正しいが、弊社の規模では直す必要がなかった |
内訳を言い直すと、2件は修正、1件は誤った指摘、1件は仕様の確認で終わり、2件はリスクを承知で見送りです。
見送った2件は「間違っている」のではなく、直す手間に見合わないと判断したものです。会社の規模が変われば直すことになります。誤指摘の1件にいたっては、そのまま従っていたら動いているものを壊すところでした。
この内訳が、次の「落とし穴」の章につながります。
Claude CodeとCodexの違い(役割を分けている根拠)
どちらが優秀かという比べ方をしていません。
弊社が見ているのは「何を知っているか」と「何を読むか」の違いです。ここが違うから、役割を分ける意味が出ます。
| Claude Code | Codex | |
|---|---|---|
| 社内のルールや経緯 | 蓄積してある | 知らない |
| 読む指示ファイル | CLAUDE.md | AGENTS.md(既定では前者を読まない) |
| 外部サービスとの接続 | つないである | 引き継がれない |
| 課金の経路 | Anthropicの月額プラン | ChatGPTの月額プラン(APIキー指定も可) |
| 呼び出し方 | ふだんの作業画面 | codex exec で1回ずつ |
| 弊社での担当 | 作る | 点検する |
一番下の行だけ見ると好みの問題に見えますが、根拠は上の2行です。
社内の事情を知らないほうが、別の視点から読める。それがこの表の言いたいことです。知っていると「そういう意図だろう」と補って読んでしまいます。
ただし「知らない=正しく読める」ではありません。知らないせいで的外れな指摘も出ます(実際、後述の6件のうち1件は「こちらの仕様どおり」でした)。期待する動作や権限まわりの前提は、指示文に書いて渡す必要があります。
Claude CodeとCodexの使い分け
役割をはっきり分けています。
| 担当 | 理由 | |
|---|---|---|
| 作る | Claude Code | 社内のルール・過去のやり取り・お客様の情報を持っているのはこちらだけ |
| 点検する | Codex | 作った経緯を知らないので、別の視点から読める |
逆にしていません。
Codexには制作をさせていません。弊社の場合、社内のルールや判断基準がClaude Code側に積み上がっていて、Codexには引き継がれないからです。知らないまま作らせると、方針から外れたものが出てきます。
Claude Codeの作業中に、ターミナル(文字で命令を打つ画面)でこう打つだけで点検が走ります。
codex exec --skip-git-repo-check --sandbox read-only "<点検してほしい内容>"
結果はそのまま画面に出ます。
--sandbox read-only を付けてください。これは「読むだけ」に権限を制限する指定です。指示文に「ファイルは変更しないで」と書くだけでは、お願いしているにすぎません。書き込みを許可する設定も存在するので、権限の側で止めるのが確実です。
Codexで、記事の事実確認もしています
ここは、他ではあまり見かけない使い方だと思います。
弊社はブログ記事を公開する前の事実確認にも、別のAIを通しています。
やっていることはコードのときと同じです。
書いた本人(Claude Code)が「調べて書きました」と言っても、そのまま信じません。別のAIに「事実として間違っている記述・裏が取れない断定・危険な助言だけを指摘して」と頼みます。
実際に止まったもの
・公式ドキュメントの日本語版と英語版で説明が食い違っていたのを指摘され、英語版が正しいと分かった
・法律に関する記述で、表示義務のある項目が抜けていた
・自社の記録の数字が間違っていて、会社の帳簿のほうを直すことになった
どれも、書いた側は「確認した」つもりでいたものです。
ホームページ制作の会社なので、公開するものの正確さは商品の一部です。
AIに書かせるなら、AIで点検する工程まで含めて設計しないと、速くなった分だけ間違いが増えます。
GPT-6 Astraが来ました(2026年9月)
2026年9月3日、OpenAIが新しいモデル「GPT-6 Astra」を発表しました。
初日は限られた組織向けで、その後ChatGPTのPlus・Pro・Business・Enterpriseの各プランへ順次展開されました。
弊社でもCodex側の点検役をこれに切り替えました。
切り替え自体は、実行するときにモデル名を指定するだけです。
gpt-6-astra です
ここで少しつまずきました。
gpt-6 や astra と指定すると、「このモデルはChatGPTアカウントでは使えません」と拒否されます。
正しい書き方は gpt-6-astra です。3つ試して、これだけが通りました。
お金の話:サブスク経由とAPI経由で、支払いがまったく違います
同じモデルでも、どちらの経路で使うかで支払いが変わります。
ここは最初に確かめておいたほうがいい部分です。
| 支払い | |
|---|---|
| ChatGPTのサブスク経由 | 月額プランの利用枠の範囲内なら追加請求は出ません。枠を使い切った場合は、追加のクレジットを買うか、枠が回復するのを待ちます |
| APIキー経由 | 使った分だけの従量課金。公式の単価は入力100万トークンあたり$10、出力$50(トークンはAIが処理する文章量の単位で、日本語ならおおよそ1文字=1トークン前後) ※入力が27万2千トークンを超えると、そのやり取り全体が長い文章向けの単価(入力$20・出力$75)になります |
弊社がそれまでCodexの既定にしていた gpt-5.5 と比べると、入力で2倍・出力で約1.7倍。
直前の上位モデル(gpt-5.6 Sol)と比べると入力・出力とも2.5倍です。点検のように長いコードや文章を丸ごと読ませる使い方は入力が一気に膨らむので、APIで気軽に回すと月末に驚くことになります。
「画像生成用に OPENAI_API_KEY(パソコンに覚えさせておく鍵の設定)を入れているから、勝手に従量課金になっているのでは」と心配になりますが、Codex CLIは既定でChatGPTのログインを優先します。環境変数にキーがあっても、そのままではサブスク経由です。
APIキー側に落ちるのは、ChatGPTでログインしていない場合か、設定で明示的にAPIキーを指定した場合です。
確認は codex login status が一番簡単です。Logged in using ChatGPT と出ればサブスク経由です。
詳しく見るなら codex doctor の auth 欄で、stored auth mode chatgpt と stored API key false を確認します。
このとき同じ欄に auth env vars present OPENAI_API_KEY と出ることがありますが、これは「環境変数が存在する」という表示なだけで、課金経路とは別です。ここで慌てないでください。
APIキーそのものの扱い方はClaude Codeに外部APIキーを渡す前ににまとめました。画像生成の記事でも、同じキーの話に触れています。
併用の落とし穴4つ
良いことばかりではありません。知らないと損をするものを挙げます。
1|指摘を鵜呑みにすると、過剰に直すことになります
最初の監査で出てきた6件のうち、本当に直すべきだったのは2件でした。
残りは、はっきり間違っている指摘が1件、こちらの仕様どおりが1件、許容範囲が2件。点検役は同僚であって、上司ではありません。言われたまま直すと、直さなくていいものまで壊します。
2|同じ利用枠を、他の作業と取り合います
Codexの利用枠は、点検だけのものではありません。
画像を作らせたり調査させたりすると同じ枠を食います。公式の説明によれば、画像生成は通常のやり取りに比べて平均3〜5倍の速さで枠を消費します。点検に回す分がなくなるので、重い作業を続けるときは順番を考える必要があります。
3|Claude Code側の設定は引き継がれません
Claude Codeに書き込んだルール、覚えさせた社内の事情、つないだ外部サービス。これらはCodexには一切引き継がれません。
Codexが読むのは AGENTS.md という別のファイルです(既定ではClaude Code側の CLAUDE.md を読みません。設定を足せば読ませることもできます)。弊社は事故防止のルールだけをこちらに書き写しています。
4|同じファイルを2つのAIに同時に触らせない
これは実際にやって痛い目を見ました。
片方が書いている途中のファイルをもう片方が読むと、壊れた中間状態を正だと思って作業を進めます。
読むだけに制限しても、これは防げません。作る側の書き込みが終わってから点検を始めるか、その時点のコピーを取って、そちらを点検させるのが確実です。点検の最中に元のファイルを触らない、というのも同じことです。
エンジニアではない会社が始めるなら
「開発チームの話でしょう」と思われるかもしれませんが、むしろ人が少ない会社ほど効きます。社内に確認してくれる人がいないからです。
| 順 | やること |
|---|---|
| 1 | まずは片方だけで慣れる。いきなり2つ契約しない |
| 2 | 「作ったものが正しいか自分で判断できない」と感じたら、そこが導入時期 |
| 3 | 点検役として読ませるだけから始める。書き換えは許可しない(権限の上げ方はこちら) |
| 4 | 指摘は必ず自分で確かめてから直す。確かめられない指摘は、直さずに保留する |
| 5 | 慣れてきたら、事故防止のルールを AGENTS.md に書き写す |
順番を飛ばして2つ同時に使い始めると、どちらの設定がどう効いているのか分からなくなります。実際、弊社もそこで一度混乱しました。
4番目が一番むずかしいところです。「正しいか判断できないから点検役を入れた」のに、その指摘が正しいかも判断できないという状態が起きます。
そのときは直さないでください。本番に反映せず、手元で試せる環境で再現するか、分かる人に見てもらってから決めます。
お金や個人情報が絡む部分は、確かめられるまで公開しない。これだけ決めておけば、判断がつかなくても事故にはなりません。
よくある質問
Claude CodeとCodexは両方契約しないと併用できませんか
それぞれのアカウントは必要ですが、両方に月額を払う必要はありません。
Codexは無料プランでも軽い作業なら使えますし、月額の安いプランやAPIキー経由という選び方もあります。必要なモデルと使う量で決めてください。
ただしこの記事で使っているGPT-6 Astraは、無料プランとGoプランでは使えません。Astraを点検役にしたい場合はPlus以上が必要です。
点検役として使うだけなら実行回数はそれほど多くないので、まず安いプランで足りるかを試すのが現実的です。
Claude CodeとCodexはどちらが優秀ですか
その比べ方をやめたのが、この記事の趣旨です。
弊社の実感では、優劣ではなく「作った側か、そうでないか」の差のほうが大きく出ました。ただし同じ条件で比較したわけではないので、これは弊社の観察であって検証結果ではありません。
Codexに点検させるとき、指示はどう書けばよいですか
具体的にするほど精度が上がります。弊社が必ず入れているのは次の4つです。
「ファイル名と行番号を示す」「推測や一般論は不要」「重大度を付ける」「ファイルは変更しない」。これを書かないと、当たり障りのない感想が返ってきます。
あわせて実行時に --sandbox read-only を付け、権限の側でも書き込みを止めておきます。
GPT-6 AstraをCodexで使うときのモデル名は何ですか
gpt-6-astra です。gpt-6 や astra と指定すると、ChatGPTアカウントでは使えないと拒否されます。
ChatGPTのサブスクリプション経由なら、利用枠の範囲内で追加の請求は出ません。枠を使い切った場合は、追加クレジットを買うか回復を待ちます。
知らないうちにAPI課金になることはありますか
Codex CLIは既定でChatGPTのログインを優先するので、環境変数にAPIキーがあってもそのままではサブスク経由です。
不安なら codex login status を実行してください。Logged in using ChatGPT と出れば問題ありません。
機密情報を扱うコードでも点検に出せますか
社内の方針次第です。点検に出すということは、その内容を外部のサービスに渡すということです。
お客様からお預かりしている情報が含まれる場合は、契約上どこまで許されるかを先に確認してください。「便利だから」で始める部分ではありません。
まとめ
併用の目的は、作業を速くすることではありません。
自分では気づけないものを見つけることです。
・書いた本人が点検しても見つからなかった。構造の問題だというのは弊社の見立て(仮説)
・弊社は「作る=Claude Code、点検=Codex」で固定している
・コードだけでなく公開前の記事の事実確認にも通している
・GPT-6 Astraのモデル名は gpt-6-astra。サブスクの枠内なら追加料金は出ない
・Codexは既定でサブスクを優先する。心配なら codex login status で1行確認するだけ
・指摘は鵜呑みにしない。6件中、直したのは2件。確かめられない指摘は保留する
弊社はホームページ制作の会社ですが、こうした仕組みを自分たちで組んで日々の仕事を回しています。
実際に詰まったところを、そのまま記事にしています。