Claude CodeとCodexの両方を使っていますが、正直モデルは もはやどれを選択しても大差ないと思いますね。
Opus 5を使用してコーディングしても、抜け落ちるときは抜け落ちる。
重要なのはモデル選択よりも、AIが何回ソースコードに触れているかだと思います。
つまり、設計ポイントを分割し都度ソースコードを調査させる、レビューは観点を変えて反復させるなど。絶対に憶測だけで回答させないこと。
こうすることで、抜け漏れや間違いをAI自身が発見する確率が上がります。
レビューはAIにやらせる方が良いです。人がレビューするよりよく気付きます。
人がやるべきことは、設計判断と動作確認(これは期待する振る舞いになっているかということ)だと、最近、考えています