AI時短ラボ
検索

AIコーディングの記事

「AIコーディング」に関連するAIニュースと解説、191本。新しい順に並べています。

解除

AIコーディング の記事:191件

Anthropic、Claudeがフェルマーの最終定理の「計算機検証済みの完全な証明」を11日で作成──Leanで1,300万行、中間定理29,500本、Mathlibの5倍超。数十のエージェントがProve2Me(定理のDAG)で分担、Fable 5.1相当の社内モデルで出力約60億トークン。Buzzard氏「数学の公理以外の仮定なし」。Max 3契約で三素数定理も3日の記事画像

Anthropic、Claudeがフェルマーの最終定理の「計算機検証済みの完全な証明」を11日で作成 Leanで1,300万行、中間定理29,500本、Mathlibの5倍超。数十のエージェントがProve2Me(定理のDAG)で分担、Fable 5.1相当の社内モデルで出力約60億トークン。Buzzard氏「数学の公理以外の仮定なし」。Max 3契約で三素数定理も3日

検証(発表 9月4日)
Anthropic「Claude Platformで費用を下げつつ性能を上げる3つの直し方」──①プロンプトキャッシュの命中率(時刻を先頭に置かない、長い処理はTTL1時間)②古いモデル向けの「2回検証しろ」を消す(Opus 5移行で費用14.6%減・精度5.3%増)③effortの較正(低effortのFable 5.1は高effortのFable 5と同等で費用3分の1)の記事画像

Anthropic「Claude Platformで費用を下げつつ性能を上げる3つの直し方」 ①プロンプトキャッシュの命中率(時刻を先頭に置かない、長い処理はTTL1時間)②古いモデル向けの「2回検証しろ」を消す(Opus 5移行で費用14.6%減・精度5.3%増)③effortの較正(低effortのFable 5.1は高effortのFable 5と同等で費用3分の1)

検証(発表 9月8日)
Anthropicが「コマースエージェント」の設計図を公開──Claudeの買い物エージェントはカートが最大35%大きく購入完了が60%高い(小売各社の実績)。要点は「サブエージェントでなくスキル」「UI部品はツール」「3分の1超のトラフィックが使う指示はシステムプロンプト」「プロンプトキャッシュは90〜99%命中を最初から設計」。Visa・Mastercard・Shopify等がコメントの記事画像

Anthropicが「コマースエージェント」の設計図を公開 Claudeの買い物エージェントはカートが最大35%大きく購入完了が60%高い(小売各社の実績)。要点は「サブエージェントでなくスキル」「UI部品はツール」「3分の1超のトラフィックが使う指示はシステムプロンプト」「プロンプトキャッシュは90〜99%命中を最初から設計」。Visa・Mastercard・Shopify等がコメント

検証(発表 9月2日)
Google「AI Agents Challenge」上位に共通した4つの設計──①自分のツール層をMCPサーバーとして他のエージェントにも開く②呼び出し連鎖でなくイベントバスで並列に反応③フォールバック先のFlashも同じ検証関数を通す④正規表現→10トークンの分類→本モデルの3層で4割超をモデル呼び出し前に処理。「名前つきプロンプトの連鎖」は多エージェントではないの記事画像

Google「AI Agents Challenge」上位に共通した4つの設計 ①自分のツール層をMCPサーバーとして他のエージェントにも開く②呼び出し連鎖でなくイベントバスで並列に反応③フォールバック先のFlashも同じ検証関数を通す④正規表現→10トークンの分類→本モデルの3層で4割超をモデル呼び出し前に処理。「名前つきプロンプトの連鎖」は多エージェントではない

検証(発表 9月2日)
Google「ハーネス・エンジニアリングの解剖」──Terminal-BenchやDeepSWEの総合点が数ポイント動いても「なぜ」は分からない。「曖昧な指示で聞き返すか」「ビルドファイルを変えたら検証を回すか」を単体テストのように断言する「行動評価」を、Antigravity SDK+pytestで5秒以内に回す。評価は「ドッグフーディングで自分のコードベースを扱えるようになった後」からの記事画像

Google「ハーネス・エンジニアリングの解剖」 Terminal-BenchやDeepSWEの総合点が数ポイント動いても「なぜ」は分からない。「曖昧な指示で聞き返すか」「ビルドファイルを変えたら検証を回すか」を単体テストのように断言する「行動評価」を、Antigravity SDK+pytestで5秒以内に回す。評価は「ドッグフーディングで自分のコードベースを扱えるようになった後」から

検証(発表 9月9日)
Google Labs「Julesで測るべきもの」──コーディングエージェントは「頼まれたタスク」から「目標」へ。SWE-Benchは課題の完了しか測れないので、社内の705件のバグ(1,178 CL)を時間的近接と意味的類似で束ねて「目標」の正解を作り、修正前の状態に戻してエージェントに探索させLLMで5段階採点。1回の探索で平均4.5、探索を2回→3回にするとHit@5が33%→57%の記事画像

Google Labs「Julesで測るべきもの」 コーディングエージェントは「頼まれたタスク」から「目標」へ。SWE-Benchは課題の完了しか測れないので、社内の705件のバグ(1,178 CL)を時間的近接と意味的類似で束ねて「目標」の正解を作り、修正前の状態に戻してエージェントに探索させLLMで5段階採点。1回の探索で平均4.5、探索を2回→3回にするとHit@5が33%→57%

検証(発表 6月22日)
Google DeepMind「クライアントSDKの生成はオープンであるべき」──2026年5月、使っていたSDK生成ベンダーが買収され突然の終了。Interactions APIのGA直前に乗り換え、Speakeasyと組んでOpenAPI生成スイートをAGPLv3でオープンソース化。7言語のSDK・エージェント向けCLI・ドキュメントMCPサーバーを生成、6ターゲットを約1人で保守の記事画像

Google DeepMind「クライアントSDKの生成はオープンであるべき」 2026年5月、使っていたSDK生成ベンダーが買収され突然の終了。Interactions APIのGA直前に乗り換え、Speakeasyと組んでOpenAPI生成スイートをAGPLv3でオープンソース化。7言語のSDK・エージェント向けCLI・ドキュメントMCPサーバーを生成、6ターゲットを約1人で保守

検証(発表 9月17日)
Google「autofinetune」──仕様書1枚を書いて寝ると、エージェントが一晩でLoRAのランク・学習率・バッチを探索し、改善したコミットだけGitに残す。TPU v5eでFunctionGemma 270MのSFTを20回、TPU v6eでGemma 3 1BのGRPOを40回回し報酬約10%改善。Tunix+Antigravity CLI+Gemini 3.7 Flashの記事画像

Google「autofinetune」 仕様書1枚を書いて寝ると、エージェントが一晩でLoRAのランク・学習率・バッチを探索し、改善したコミットだけGitに残す。TPU v5eでFunctionGemma 270MのSFTを20回、TPU v6eでGemma 3 1BのGRPOを40回回し報酬約10%改善。Tunix+Antigravity CLI+Gemini 3.7 Flash

検証(発表 9月11日)
MiniMax公式の告知画像。MiniMax M3.1 Flash-Preview、Available now on MiniMax Code。モデル選択とEffortのメニュー

MiniMax、新モデル「M3.1-Flash-Preview」をMiniMax Codeで公開 推論の強さは5段階、前日のリークは「来週」と書いていた

モデル
Anthropic「エージェントのコーディングがCIを圧迫している」──CIジョブが6か月で25倍、テスト選択サービスに当てた応急処置は70日・29日・1日未満しか持たず、状態を外に出す再設計で安定。Claude Tagの長期セッションが遅延5万件超で担当者を呼び出し、設計変更を主張し続けたの記事画像

Anthropic「エージェントのコーディングがCIを圧迫している」 CIジョブが6か月で25倍、テスト選択サービスに当てた応急処置は70日・29日・1日未満しか持たず、状態を外に出す再設計で安定。Claude Tagの長期セッションが遅延5万件超で担当者を呼び出し、設計変更を主張し続けた

検証(発表 9月14日)
覆面AI「Pixel Canary」、トークン数はQwen3.5以降の語彙と95本すべて一致──名前はGoogle風でもGoogleの辞書とは24本、推論には「You are Qwen」の記事画像

覆面AI「Pixel Canary」、トークン数はQwen3.5以降の語彙と95本すべて一致 名前はGoogle風でもGoogleの辞書とは24本、推論には「You are Qwen」

モデル
Appleの研究「Shared Selective Persistent Memory」──エージェントに会話の全履歴を持たせると成績が下がる(71%)、何も持たせないと79%、「4種類だけ選んで残す」と96%。ゼロトークンでデータ更新(14倍速)、要約駆動で1回あたりのトークン97分の1、記憶はワークスペース単位で他の人に渡せるの記事画像

Appleの研究「Shared Selective Persistent Memory」 エージェントに会話の全履歴を持たせると成績が下がる(71%)、何も持たせないと79%、「4種類だけ選んで残す」と96%。ゼロトークンでデータ更新(14倍速)、要約駆動で1回あたりのトークン97分の1、記憶はワークスペース単位で他の人に渡せる

研究(発表 9月16日)
Claude Code、autoモードのclassifierがAPI/Enterprise/Bedrock/Vertex/Foundryでもサーバー側実行に既定変更──オーバーヘッド課金なし(v2.1.278)の記事画像

Claude Code、autoモードのclassifierがAPI/Enterprise/Bedrock/Vertex/Foundryでもサーバー側実行に既定変更 オーバーヘッド課金なし(v2.1.278)

検証
Claude Code、Pro/Team StandardプランでOpus 5.5が既定モデルに──何も設定しなければSonnetでなくOpusが動くの記事画像

Claude Code、Pro/Team StandardプランでOpus 5.5が既定モデルに 何も設定しなければSonnetでなくOpusが動く

検証
Cline、日本からオープンウェイトモデルを配信する「ai&」に新規対応(既定モデルGLM 5.3)──DesktopアプリもLinux初対応の記事画像

Cline、日本からオープンウェイトモデルを配信する「ai&」に新規対応(既定モデルGLM 5.3) DesktopアプリもLinux初対応

検証
Cursor公式changelogのOG画像。「Changelog · September 23, 2026」「Two Cursor Bots: Rollouts and Security Reviewer updates」の文字

Cursorが「Rollouts」と「Security Review」を追加 デプロイ監視とPRの脆弱性レビューを担う新ボット2つ

検証
Cognition「Introducing SWE-2: Pushing the Pareto Frontier」のOG画像

Cognition、Devinの次世代コーディングモデル「SWE-2」をエージェント選択の研究プレビューに追加 有効化はエンタープライズ管理者→組織管理者の2段階、Fable 5.1と組む「Fusion」にも先行採用

モデル
低リスクなツール呼び出しは自動承認、Codexエージェントはプランモードに対応──GitHub Copilot for JetBrains 1.18.0の記事画像

低リスクなツール呼び出しは自動承認、Codexエージェントはプランモードに対応 GitHub Copilot for JetBrains 1.18.0

検証
GitHub CopilotにOpenAIのGPT-6 Sol・GPT-6 Lunaが追加──対応プランとモデルピッカー一覧の記事画像

GitHub CopilotにOpenAIのGPT-6 Sol・GPT-6 Lunaが追加 対応プランとモデルピッカー一覧

検証
OSが守れないなら実行しない──GitHub Copilotアプリにローカルサンドボックスがパブリックプレビュー追加の記事画像

OSが守れないなら実行しない GitHub Copilotアプリにローカルサンドボックスがパブリックプレビュー追加

検証
Google「ADK for Kotlin 1.0」が正式版──Python版・Java版のADK 1.0と同じ機能に加え、Android向けの端末内エージェント(LiteRT-LM・ML Kitベータ)、Firebase AI Logicのハイブリッド、RoomとAppSearchで状態の保存。@Toolと@Paramでスキーマを自動生成、SKILL.mdで手順を段階的に読むの記事画像

Google「ADK for Kotlin 1.0」が正式版 Python版・Java版のADK 1.0と同じ機能に加え、Android向けの端末内エージェント(LiteRT-LM・ML Kitベータ)、Firebase AI Logicのハイブリッド、RoomとAppSearchで状態の保存。@Toolと@Paramでスキーマを自動生成、SKILL.mdで手順を段階的に読む

検証(発表 9月9日)
Zed v1.21.0、Opus 5.5とGPT-6 3モデルにBYOK追加──SuperGrokサインインも新設の記事画像

Zed v1.21.0、Opus 5.5とGPT-6 3モデルにBYOK追加 SuperGrokサインインも新設

検証
Claude Opus 5.5は本当に最強か──第三者ベンチマーク2社で総合1位、研究課題で初の人間基準超え。ただしフォールバック込みの数字と、筆者が見た「暴れ馬」の癖の記事画像動画

Claude Opus 5.5は本当に最強か 第三者ベンチマーク2社で総合1位、研究課題で初の人間基準超え。ただしフォールバック込みの数字と、筆者が見た「暴れ馬」の癖

モデル
Claude Codeの1タスクはいくらかかるか──ターン数・キャッシュ・出力トークンの内訳をAnthropicが公式ブログで示すの記事画像

Claude Codeの1タスクはいくらかかるか ターン数・キャッシュ・出力トークンの内訳をAnthropicが公式ブログで示す

検証

古い記事は月別アーカイブから ›