AIコーディングの記事
「AIコーディング」に関連するAIニュースと解説、191本。新しい順に並べています。
AIコーディング の記事:191件
Anthropic、Claudeがフェルマーの最終定理の「計算機検証済みの完全な証明」を11日で作成 Leanで1,300万行、中間定理29,500本、Mathlibの5倍超。数十のエージェントがProve2Me(定理のDAG)で分担、Fable 5.1相当の社内モデルで出力約60億トークン。Buzzard氏「数学の公理以外の仮定なし」。Max 3契約で三素数定理も3日
Anthropic、Claudeがフェルマーの最終定理の「計算機検証済みの完全な証明」を11日で作成Leanで1,300万行、中間定理29,500本、Mathlibの5倍超。数十のエージェントがProve2Me(定理のDAG)で分担、Fable 5.1相当の社内モデルで出力約60億トークン。Buzzard氏「数学の公理以外の仮定なし」。Max 3契約で三素数定理も3日
検証
Anthropic「Claude Platformで費用を下げつつ性能を上げる3つの直し方」 ①プロンプトキャッシュの命中率(時刻を先頭に置かない、長い処理はTTL1時間)②古いモデル向けの「2回検証しろ」を消す(Opus 5移行で費用14.6%減・精度5.3%増)③effortの較正(低effortのFable 5.1は高effortのFable 5と同等で費用3分の1)
Anthropic「Claude Platformで費用を下げつつ性能を上げる3つの直し方」①プロンプトキャッシュの命中率(時刻を先頭に置かない、長い処理はTTL1時間)②古いモデル向けの「2回検証しろ」を消す(Opus 5移行で費用14.6%減・精度5.3%増)③effortの較正(低effortのFable 5.1は高effortのFable 5と同等で費用3分の1)
検証
Anthropicが「コマースエージェント」の設計図を公開 Claudeの買い物エージェントはカートが最大35%大きく購入完了が60%高い(小売各社の実績)。要点は「サブエージェントでなくスキル」「UI部品はツール」「3分の1超のトラフィックが使う指示はシステムプロンプト」「プロンプトキャッシュは90〜99%命中を最初から設計」。Visa・Mastercard・Shopify等がコメント
Anthropicが「コマースエージェント」の設計図を公開Claudeの買い物エージェントはカートが最大35%大きく購入完了が60%高い(小売各社の実績)。要点は「サブエージェントでなくスキル」「UI部品はツール」「3分の1超のトラフィックが使う指示はシステムプロンプト」「プロンプトキャッシュは90〜99%命中を最初から設計」。Visa・Mastercard・Shopify等がコメント
検証
Google「AI Agents Challenge」上位に共通した4つの設計 ①自分のツール層をMCPサーバーとして他のエージェントにも開く②呼び出し連鎖でなくイベントバスで並列に反応③フォールバック先のFlashも同じ検証関数を通す④正規表現→10トークンの分類→本モデルの3層で4割超をモデル呼び出し前に処理。「名前つきプロンプトの連鎖」は多エージェントではない
Google「AI Agents Challenge」上位に共通した4つの設計①自分のツール層をMCPサーバーとして他のエージェントにも開く②呼び出し連鎖でなくイベントバスで並列に反応③フォールバック先のFlashも同じ検証関数を通す④正規表現→10トークンの分類→本モデルの3層で4割超をモデル呼び出し前に処理。「名前つきプロンプトの連鎖」は多エージェントではない
検証
Google「ハーネス・エンジニアリングの解剖」 Terminal-BenchやDeepSWEの総合点が数ポイント動いても「なぜ」は分からない。「曖昧な指示で聞き返すか」「ビルドファイルを変えたら検証を回すか」を単体テストのように断言する「行動評価」を、Antigravity SDK+pytestで5秒以内に回す。評価は「ドッグフーディングで自分のコードベースを扱えるようになった後」から
Google「ハーネス・エンジニアリングの解剖」Terminal-BenchやDeepSWEの総合点が数ポイント動いても「なぜ」は分からない。「曖昧な指示で聞き返すか」「ビルドファイルを変えたら検証を回すか」を単体テストのように断言する「行動評価」を、Antigravity SDK+pytestで5秒以内に回す。評価は「ドッグフーディングで自分のコードベースを扱えるようになった後」から
検証
Google Labs「Julesで測るべきもの」 コーディングエージェントは「頼まれたタスク」から「目標」へ。SWE-Benchは課題の完了しか測れないので、社内の705件のバグ(1,178 CL)を時間的近接と意味的類似で束ねて「目標」の正解を作り、修正前の状態に戻してエージェントに探索させLLMで5段階採点。1回の探索で平均4.5、探索を2回→3回にするとHit@5が33%→57%
Google Labs「Julesで測るべきもの」コーディングエージェントは「頼まれたタスク」から「目標」へ。SWE-Benchは課題の完了しか測れないので、社内の705件のバグ(1,178 CL)を時間的近接と意味的類似で束ねて「目標」の正解を作り、修正前の状態に戻してエージェントに探索させLLMで5段階採点。1回の探索で平均4.5、探索を2回→3回にするとHit@5が33%→57%
検証
Google DeepMind「クライアントSDKの生成はオープンであるべき」 2026年5月、使っていたSDK生成ベンダーが買収され突然の終了。Interactions APIのGA直前に乗り換え、Speakeasyと組んでOpenAPI生成スイートをAGPLv3でオープンソース化。7言語のSDK・エージェント向けCLI・ドキュメントMCPサーバーを生成、6ターゲットを約1人で保守
Google DeepMind「クライアントSDKの生成はオープンであるべき」2026年5月、使っていたSDK生成ベンダーが買収され突然の終了。Interactions APIのGA直前に乗り換え、Speakeasyと組んでOpenAPI生成スイートをAGPLv3でオープンソース化。7言語のSDK・エージェント向けCLI・ドキュメントMCPサーバーを生成、6ターゲットを約1人で保守
検証
Google「autofinetune」 仕様書1枚を書いて寝ると、エージェントが一晩でLoRAのランク・学習率・バッチを探索し、改善したコミットだけGitに残す。TPU v5eでFunctionGemma 270MのSFTを20回、TPU v6eでGemma 3 1BのGRPOを40回回し報酬約10%改善。Tunix+Antigravity CLI+Gemini 3.7 Flash
Google「autofinetune」仕様書1枚を書いて寝ると、エージェントが一晩でLoRAのランク・学習率・バッチを探索し、改善したコミットだけGitに残す。TPU v5eでFunctionGemma 270MのSFTを20回、TPU v6eでGemma 3 1BのGRPOを40回回し報酬約10%改善。Tunix+Antigravity CLI+Gemini 3.7 Flash
検証

MiniMax、新モデル「M3.1-Flash-Preview」をMiniMax Codeで公開 推論の強さは5段階、前日のリークは「来週」と書いていた
MiniMax、新モデル「M3.1-Flash-Preview」をMiniMax Codeで公開推論の強さは5段階、前日のリークは「来週」と書いていた
モデル
Anthropic「エージェントのコーディングがCIを圧迫している」 CIジョブが6か月で25倍、テスト選択サービスに当てた応急処置は70日・29日・1日未満しか持たず、状態を外に出す再設計で安定。Claude Tagの長期セッションが遅延5万件超で担当者を呼び出し、設計変更を主張し続けた
Anthropic「エージェントのコーディングがCIを圧迫している」CIジョブが6か月で25倍、テスト選択サービスに当てた応急処置は70日・29日・1日未満しか持たず、状態を外に出す再設計で安定。Claude Tagの長期セッションが遅延5万件超で担当者を呼び出し、設計変更を主張し続けた
検証
覆面AI「Pixel Canary」、トークン数はQwen3.5以降の語彙と95本すべて一致 名前はGoogle風でもGoogleの辞書とは24本、推論には「You are Qwen」
覆面AI「Pixel Canary」、トークン数はQwen3.5以降の語彙と95本すべて一致名前はGoogle風でもGoogleの辞書とは24本、推論には「You are Qwen」
モデル
Appleの研究「Shared Selective Persistent Memory」 エージェントに会話の全履歴を持たせると成績が下がる(71%)、何も持たせないと79%、「4種類だけ選んで残す」と96%。ゼロトークンでデータ更新(14倍速)、要約駆動で1回あたりのトークン97分の1、記憶はワークスペース単位で他の人に渡せる
Appleの研究「Shared Selective Persistent Memory」エージェントに会話の全履歴を持たせると成績が下がる(71%)、何も持たせないと79%、「4種類だけ選んで残す」と96%。ゼロトークンでデータ更新(14倍速)、要約駆動で1回あたりのトークン97分の1、記憶はワークスペース単位で他の人に渡せる
研究
Claude Code、autoモードのclassifierがAPI/Enterprise/Bedrock/Vertex/Foundryでもサーバー側実行に既定変更 オーバーヘッド課金なし(v2.1.278)
Claude Code、autoモードのclassifierがAPI/Enterprise/Bedrock/Vertex/Foundryでもサーバー側実行に既定変更オーバーヘッド課金なし(v2.1.278)
検証
Claude Code、Pro/Team StandardプランでOpus 5.5が既定モデルに 何も設定しなければSonnetでなくOpusが動く
Claude Code、Pro/Team StandardプランでOpus 5.5が既定モデルに何も設定しなければSonnetでなくOpusが動く
検証
Cline、日本からオープンウェイトモデルを配信する「ai&」に新規対応(既定モデルGLM 5.3) DesktopアプリもLinux初対応
Cline、日本からオープンウェイトモデルを配信する「ai&」に新規対応(既定モデルGLM 5.3)DesktopアプリもLinux初対応
検証
Cursorが「Rollouts」と「Security Review」を追加 デプロイ監視とPRの脆弱性レビューを担う新ボット2つ
Cursorが「Rollouts」と「Security Review」を追加デプロイ監視とPRの脆弱性レビューを担う新ボット2つ
検証
Cognition、Devinの次世代コーディングモデル「SWE-2」をエージェント選択の研究プレビューに追加 有効化はエンタープライズ管理者→組織管理者の2段階、Fable 5.1と組む「Fusion」にも先行採用
Cognition、Devinの次世代コーディングモデル「SWE-2」をエージェント選択の研究プレビューに追加有効化はエンタープライズ管理者→組織管理者の2段階、Fable 5.1と組む「Fusion」にも先行採用
モデル
低リスクなツール呼び出しは自動承認、Codexエージェントはプランモードに対応 GitHub Copilot for JetBrains 1.18.0
低リスクなツール呼び出しは自動承認、Codexエージェントはプランモードに対応GitHub Copilot for JetBrains 1.18.0
検証
GitHub CopilotにOpenAIのGPT-6 Sol・GPT-6 Lunaが追加 対応プランとモデルピッカー一覧
GitHub CopilotにOpenAIのGPT-6 Sol・GPT-6 Lunaが追加対応プランとモデルピッカー一覧
検証
OSが守れないなら実行しない GitHub Copilotアプリにローカルサンドボックスがパブリックプレビュー追加
OSが守れないなら実行しないGitHub Copilotアプリにローカルサンドボックスがパブリックプレビュー追加
検証
Google「ADK for Kotlin 1.0」が正式版 Python版・Java版のADK 1.0と同じ機能に加え、Android向けの端末内エージェント(LiteRT-LM・ML Kitベータ)、Firebase AI Logicのハイブリッド、RoomとAppSearchで状態の保存。@Toolと@Paramでスキーマを自動生成、SKILL.mdで手順を段階的に読む
Google「ADK for Kotlin 1.0」が正式版Python版・Java版のADK 1.0と同じ機能に加え、Android向けの端末内エージェント(LiteRT-LM・ML Kitベータ)、Firebase AI Logicのハイブリッド、RoomとAppSearchで状態の保存。@Toolと@Paramでスキーマを自動生成、SKILL.mdで手順を段階的に読む
検証
Zed v1.21.0、Opus 5.5とGPT-6 3モデルにBYOK追加 SuperGrokサインインも新設
Zed v1.21.0、Opus 5.5とGPT-6 3モデルにBYOK追加SuperGrokサインインも新設
検証
Claude Opus 5.5は本当に最強か 第三者ベンチマーク2社で総合1位、研究課題で初の人間基準超え。ただしフォールバック込みの数字と、筆者が見た「暴れ馬」の癖
Claude Opus 5.5は本当に最強か第三者ベンチマーク2社で総合1位、研究課題で初の人間基準超え。ただしフォールバック込みの数字と、筆者が見た「暴れ馬」の癖
モデル
Claude Codeの1タスクはいくらかかるか ターン数・キャッシュ・出力トークンの内訳をAnthropicが公式ブログで示す
Claude Codeの1タスクはいくらかかるかターン数・キャッシュ・出力トークンの内訳をAnthropicが公式ブログで示す
検証