Anthropic「エージェントのコーディングがCIを圧迫している」──CIジョブが6か月で25倍、テスト選択サービスに当てた応急処置は70日・29日・1日未満しか持たず、状態を外に出す再設計で安定。Claude Tagの長期セッションが遅延5万件超で担当者を呼び出し、設計変更を主張し続けた
Anthropicは2026年9月14日、社内のCI(継続的インテグレーション)を支える「テスト影響分析」サービスをどう作り直したかを公開した。同社のエンジニアは2021〜2025年比で四半期あたり8倍のコードを出し、その80%をClaudeが書く。テストの数は10倍になり、CIジョブは6か月で25倍。どのテストをどのPRで回すかを決めるサービスは、結果を記録する「リスナー」と、履歴から選ぶ「セレクター」を単一プロセスで回す設計だったため、遅延が積み上がった。コアを倍にする(70日持った)、パッケージ単位でシャーディング(29日)、毎日再起動(1日未満)の3つの応急処置を経て、インメモリのデータストアにジャーナルを書き、リスナーを状態なしで水平に増やせる構成に再設計。エンジニア1人で3週間だった。監視はClaude Tagの長期セッションで、遅延が5万ジョブを超えると担当者を呼び、繰り返し全面改修を主張していた。

2026年9月18日・日本時間時点の情報です。 claude.comのブログ(9月14日)を読んだ。「Claudeがコードの80%を書く」の先で何が詰まるかを、社内インフラの担当者が失敗込みで書いた記事で、日本語では扱われていなかった。同社の開発工程全体はAIネイティブSDLCの手引きに。
3行まとめ
- 何が詰まったか。 Anthropicのエンジニアは2021〜2025年比で四半期あたり8倍のコードを出し、その80%をClaudeが書く。PRのレビューと承認もClaudeが担う割合が大きい。テストは10倍、エンジニアは少し増えただけで、CIジョブは6か月で25倍。同社は「どのテストをどのPRで回すか」を過去の結果と関連パッケージから決めるテスト影響分析(テスト選択)サービスを持つが、結果を記録するリスナーと履歴から選ぶセレクターを、テストごとの履歴を1つの書き手で更新するために単一プロセスで回していた。リスナーが20分遅れると数万件のテスト結果がセレクターに反映されず、壊れた変更が入っても、依存が不安定になっても、テストが直っても、しばらく気づけない。
- 3つの応急処置と持った日数。 昨年10月、2日続けて呼び出しを受けてコアを倍に(70日)。2月、パッケージごとに書き手を分けるシャーディングをClaudeにコードを書かせて導入(29日)。3月、平日の午後にメモリ上限に達するようになり毎日再起動(1日未満)。再起動は遅延を余計に積み、1時間以上遅れた回では大量の結果が記録されず、セレクターは古いデータで「すでに不安定なテスト」を回し続けた(本番に未テストのコードが入ったわけではない、と明記)。
- 再設計。 Claudeの助言どおりインメモリのデータストアを与え、リスナーの各ワーカーは結果をジャーナルに追記するだけで状態を持たず水平に増やせる構成に。別の小さな消費プロセスが数秒ごとにテスト別履歴へ丸め、セレクターはそれを引く。運用費は上がるが、拡張もメモリのプロファイルも容易になった。エンジニア1人で3週間(1年前なら四半期に近かったと)。ジャーナルの容量とワーカー数の調整はClaudeがほぼ自律的に行い、以後安定している。
5万件の閾値と著者が得た3つの教訓
- 監視の使い方が具体的だ。担当者は社内版Claude Tagの長期セッションをこのサービス専用に立て、リスナーの遅延が5万ジョブを超えると呼び出され、文脈を思い出させずに続きを相談できた。Claudeは繰り返し全面改修を主張し、人間側は毎回応急処置に落ち着いた──という経緯を、会話の一部を(伏せ字つきで)載せて認めている。当サイトのClaude Tagの解説にある「長く生きるセッション」の実例
- 著者の教訓は3つ。①AIの指数を織り込む(ビルドでも購入でも、2四半期以内に25倍の負荷を前提に。v0で10〜20倍を見込むのはもはや過剰設計ではない)。②サービスにClaudeの目と耳になる計測を入れる(入るジョブ数と出るジョブ数が一致することを常に確認)。③最初から状態をプロセスの外に(重要なサービスの単一インスタンスは避ける)
- PRの形も変わっていて、Claudeは小さく細かいPRを好むためジョブ数が増え、夜間・週末もエージェントが押すので活動の下限が上がった、とある。「エンジニア1人あたりのエージェント数」がCIの負荷を決める、という見立てだ
- 数字(8倍・80%・10倍・25倍・70日・29日・5万)はすべてAnthropic自身の申告で、外部の検証はない
応急処置の日数や閾値は原文で確認
この記事の下調べで、筆者は9月18日にclaude.comのブログを取得し、3つの応急処置と持った日数・再設計の構成・Claude Tagの呼び出し閾値がその原文にあることを確認した。筆者はAnthropic社内のシステムを見ていない。
データストア製品名やCI基盤は未記載
- インメモリのデータストアの製品名
- テスト選択の具体的なアルゴリズム(「過去の成績とパッケージの関連」とだけ)
- CIの実行基盤(ベンダー名)
出典はclaude.comのブログ
- Agentic coding is straining CI. Here's how we scaled test impact analysis at Anthropic(Anthropic・2026年9月14日)
関連記事
出典・参照資料
AIニュースの解説を動画でも
YouTubeでは注目ニュースの背景を解説し、Xでは新着記事をお知らせしています。
コメント
まだコメントはありません。最初のコメントを書いてみませんか?
AIについて聞きたいことはありますか?
質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。
質問箱を見る →新しい記事をメールで受け取る
AIの新しい発表を、出典付きで整理して届けます。