📚 すべての記事
全 84 件 / 1 ページ目(全 7 ページ)
69分で5リリース — Claude Opus 5 当日対応が暴いた共通ハーネスの死角【番外編】
Claude Code 共通ハーネスを Opus 5 へ当日移行。69 分で 5 回のリリースを重ね、公開後も v0.13.2 まで model 指定、teammate の定義本文欠落、hook スキーマの無言回帰を修正した実録。
ハーネスが単一プロジェクトを卒業する — cts-harness プラグイン化・二層配布・バージョンピン【番外編】
ステアリング駆動開発(実践編)番外編第 4 弾。CTS-EC で 3 か月運用したハーネスを、CTS-POS / CTS-LOGI / CTS-AD への展開に向けて共通プラグイン cts-harness へ切り出した実録。プラグインで配れる層とリポジトリの一部であるべき層の二層分割、ホストリポジトリ契約と「静かに exit 0」ガード、共有してはいけないものの線引き、そして「EC だけ先行しても他プロジェクトは動かない」を version + SHA のプロジェクト別ピンで機構化するまで。初稿で「未実走」とした更新サイクルは同日中の v0.2.0 リリースで実走 — 主張が観測に変わるところまでを含めた実録。
遊休 90% の枠に仕事を振る — Codex 上流調査・段別モデル・verifier バッチ化【番外編】
ステアリング駆動開発(実践編)番外編第 3 弾。Claude 側のサブスク枠がタイトな一方、Codex Pro は遊休 90% 超 — この非対称を、逆順禁止の骨格を一切崩さずに解消する。「read-only 調査は逆順か」という解釈問題を ADR で確定し、調査に偽装した逆順・欠落バイアスという残余経路まで塞ぎ、verifier バッチ化をスクリプト変更ゼロで成立させるまで。枠の経済もハーネス設計の一部である、という 1 日の実録。
GPT-5.6 sol に 2 日で準拠する — CLI 更新が黙って替えるモデルと、当日中の golden set 再計測【番外編】
ステアリング駆動開発(実践編)番外編第 2 弾。GPT-5.6 sol GA の 2 日後、Codex CLI の更新が finder の実効モデルを gpt-5.5 から gpt-5.6-sol へ黙って切り替えた。サーバー側で替わる Claude のエイリアスと、CLI バイナリ側で替わる Codex の既定 —「もう一つのデフォルト追従」を実測で特定し、台帳への明文化・v1 較正チェック・難化 golden set v2 の本測(recall 天井と precision の家族差)まで、モデル世代交代の当日フルコースを記録する。
CI テスト 29 分 → 5.6 分 — 実測が「有力仮説」を殺し、退行前より速くなった日【番外編】
ステアリング駆動開発(実践編)番外編。第II部で組み上げた検証エンジンが「平時の 1 タスク」をどう流すかの実録。CI のテストジョブが数日で 14 分 → 29 分に倍増した性能退行を、起票から実測・オーナー承認・Codex 実装・CI 実測まで 1 日で是正する。design-reviewer が有力仮説の機序誤認を暴き、Phase 1 実測が 770 倍差で決着をつけ、最後は退行前の 11.5 分すら「健全ではなかった」ことが判明するまで。
クロスファミリー検証の最終型 —「正しく作る」から「自分で正しさを測り直す」へ【終章】
ステアリング駆動開発(実践編)シリーズ終章。検証を強制するハーネスに欠けていた「計測」の層を、独立に同じ思想へ到達していた個人開発ハーネスとの相互レビューから取り込む。finding-level 台帳・モデルドリフト検知・実痛駆動の剪定 —「完成」とは終わることではなく、自分の劣化を自分のデータで検出するループが閉じることである。
Claude Code の中から Codex を動かす — MCP を使わない判断と sandbox の地雷【クロスファミリー検証 第5回】
クロスファミリー検証で最も泥臭かった実装の記録。MCP でなく codex exec + シェルを選んだ積極的理由、Dev Container で bwrap sandbox を成立させる 3 条件、「sandbox 全滅でも exit 0」という最大の地雷、sudo で逆に壊れる罠、そして運用判断を埋め込んだ exit code 意味論まで。
Fable 5・Sonnet 5・Opus 4.8 の使い分けと golden set 実測 —「買うか、組むか」【クロスファミリー検証 第6回・最終回】
クロスファミリー検証パイプラインのモデル戦略編。Claude 5 ファミリー(Fable 5 / Sonnet 5)と Opus 4.8 のティア割当、effort 運用(xhigh 下限の構造的保証)、Fable 5 をサブエージェントに使わない理由、golden set v1 の自環境実測、承認と実証の分離、Sakana Fugu 時代の「買うか組むか」の判断軸で締める。
マルチ LLM オーケストレーションの台頭とクロスファミリー検証 — Sakana Fugu から Codex×Claude まで【シリーズ総論】
複数の AI モデルを束ねる動きが 2026 年に一気に加速した。Sakana Fugu のような「学習されたオーケストレーション」製品の登場と、Codex×Claude のクロスファミリー検証運用。マルチ LLM の 2 つの系統(オーケストラ型とチェック・アンド・バランス型)を整理し、実プロジェクトで標準運用に至った全 6 回シリーズの見取り図を示す。