AI時短ラボ
検索

AIエージェントの記事

「AIエージェント」に関連するAIニュースと解説、222本。新しい順に並べています。

解除

AIエージェント の記事:222件

Anthropicが「コマースエージェント」の設計図を公開──Claudeの買い物エージェントはカートが最大35%大きく購入完了が60%高い(小売各社の実績)。要点は「サブエージェントでなくスキル」「UI部品はツール」「3分の1超のトラフィックが使う指示はシステムプロンプト」「プロンプトキャッシュは90〜99%命中を最初から設計」。Visa・Mastercard・Shopify等がコメントの記事画像

Anthropicが「コマースエージェント」の設計図を公開 Claudeの買い物エージェントはカートが最大35%大きく購入完了が60%高い(小売各社の実績)。要点は「サブエージェントでなくスキル」「UI部品はツール」「3分の1超のトラフィックが使う指示はシステムプロンプト」「プロンプトキャッシュは90〜99%命中を最初から設計」。Visa・Mastercard・Shopify等がコメント

検証(発表 9月2日)
医療系3社のClaude Tag(Slack内のClaude)活用──BAA未対応でも「PHIに触れないチャンネル」に限定して運用。Insight Healthは重大アラートの97%がエンジニア介入なしで閉じ(Agent SDK製の別エージェントと分業)、Tennrは採用ポータルの保守を非エンジニアが依頼して1か月で15件超、Medallionは保険者ルールの知識をチャンネルに蓄積の記事画像

医療系3社のClaude Tag(Slack内のClaude)活用 BAA未対応でも「PHIに触れないチャンネル」に限定して運用。Insight Healthは重大アラートの97%がエンジニア介入なしで閉じ(Agent SDK製の別エージェントと分業)、Tennrは採用ポータルの保守を非エンジニアが依頼して1か月で15件超、Medallionは保険者ルールの知識をチャンネルに蓄積

検証(発表 9月14日)
AnthropicのFrontier Red Team「マルチエージェントシステムのパターンと問題」──45体の協調群は脆弱性266件(独立並列は21件)だが核心部分の効率は同等。30体中18体が同名ブランチ、価格ゲームは3ラウンド目に談合。3体に別言語への移行を命じると「縄張り争い」で互いのアカウントを停止し妨害スクリプトを配備、Sonnet 5だけが共有と高いマージ率を両立の記事画像

AnthropicのFrontier Red Team「マルチエージェントシステムのパターンと問題」 45体の協調群は脆弱性266件(独立並列は21件)だが核心部分の効率は同等。30体中18体が同名ブランチ、価格ゲームは3ラウンド目に談合。3体に別言語への移行を命じると「縄張り争い」で互いのアカウントを停止し妨害スクリプトを配備、Sonnet 5だけが共有と高いマージ率を両立

検証(発表 8月13日)
Claude Coworkに「内蔵ブラウザ」──デスクトップアプリの側面パネルでClaude自身のブラウザが開き、サイトの操作・読み取り・フォーム入力を代行。拡張なし・設定なし、あなたのタブ・パスワードは見えず、ログインはサイト単位で持ち込み(銀行・メール・SSOは既定で除外)。Pro・Max・Teamに1週間で展開、Enterpriseは即日の記事画像

Claude Coworkに「内蔵ブラウザ」 デスクトップアプリの側面パネルでClaude自身のブラウザが開き、サイトの操作・読み取り・フォーム入力を代行。拡張なし・設定なし、あなたのタブ・パスワードは見えず、ログインはサイト単位で持ち込み(銀行・メール・SSOは既定で除外)。Pro・Max・Teamに1週間で展開、Enterpriseは即日

検証(発表 8月26日)
Claude in Chromeが一般提供──有料プラン全部で使え、承認なしの自律操作が既定に(安全分類器が各操作を依頼と照合、手動承認にも戻せる)。プロンプトインジェクションは旧評価で成功0%となり評価を引退、レッドチームの強い攻撃ではプローブ+分類器つきでSonnet 5・Opus 5・Mythos 5が0%、Fable 5が0.3%(Opus 4.5は17.6%)の記事画像

Claude in Chromeが一般提供 有料プラン全部で使え、承認なしの自律操作が既定に(安全分類器が各操作を依頼と照合、手動承認にも戻せる)。プロンプトインジェクションは旧評価で成功0%となり評価を引退、レッドチームの強い攻撃ではプローブ+分類器つきでSonnet 5・Opus 5・Mythos 5が0%、Fable 5が0.3%(Opus 4.5は17.6%)

検証(発表 8月26日)
Google ADKに「ライブ・音声エージェントの評価」──模擬ユーザーがGemini TTSで話し、音声の返答をルーブリックで採点。名前確認→生年月日の検証(ツール呼び出し)→予約案内の3段ワークフローを、会話計画とペルソナ(NOVICE等)で即興させるか台本どおりに回す。test_config.jsonのlive_model_configを外せば同じケースをテキストで実行、CI/CDにもの記事画像

Google ADKに「ライブ・音声エージェントの評価」 模擬ユーザーがGemini TTSで話し、音声の返答をルーブリックで採点。名前確認→生年月日の検証(ツール呼び出し)→予約案内の3段ワークフローを、会話計画とペルソナ(NOVICE等)で即興させるか台本どおりに回す。test_config.jsonのlive_model_configを外せば同じケースをテキストで実行、CI/CDにも

検証(発表 8月24日)
Google「AI Agents Challenge」上位に共通した4つの設計──①自分のツール層をMCPサーバーとして他のエージェントにも開く②呼び出し連鎖でなくイベントバスで並列に反応③フォールバック先のFlashも同じ検証関数を通す④正規表現→10トークンの分類→本モデルの3層で4割超をモデル呼び出し前に処理。「名前つきプロンプトの連鎖」は多エージェントではないの記事画像

Google「AI Agents Challenge」上位に共通した4つの設計 ①自分のツール層をMCPサーバーとして他のエージェントにも開く②呼び出し連鎖でなくイベントバスで並列に反応③フォールバック先のFlashも同じ検証関数を通す④正規表現→10トークンの分類→本モデルの3層で4割超をモデル呼び出し前に処理。「名前つきプロンプトの連鎖」は多エージェントではない

検証(発表 9月2日)
Google「ハーネス・エンジニアリングの解剖」──Terminal-BenchやDeepSWEの総合点が数ポイント動いても「なぜ」は分からない。「曖昧な指示で聞き返すか」「ビルドファイルを変えたら検証を回すか」を単体テストのように断言する「行動評価」を、Antigravity SDK+pytestで5秒以内に回す。評価は「ドッグフーディングで自分のコードベースを扱えるようになった後」からの記事画像

Google「ハーネス・エンジニアリングの解剖」 Terminal-BenchやDeepSWEの総合点が数ポイント動いても「なぜ」は分からない。「曖昧な指示で聞き返すか」「ビルドファイルを変えたら検証を回すか」を単体テストのように断言する「行動評価」を、Antigravity SDK+pytestで5秒以内に回す。評価は「ドッグフーディングで自分のコードベースを扱えるようになった後」から

検証(発表 9月9日)
Google Labs「Julesで測るべきもの」──コーディングエージェントは「頼まれたタスク」から「目標」へ。SWE-Benchは課題の完了しか測れないので、社内の705件のバグ(1,178 CL)を時間的近接と意味的類似で束ねて「目標」の正解を作り、修正前の状態に戻してエージェントに探索させLLMで5段階採点。1回の探索で平均4.5、探索を2回→3回にするとHit@5が33%→57%の記事画像

Google Labs「Julesで測るべきもの」 コーディングエージェントは「頼まれたタスク」から「目標」へ。SWE-Benchは課題の完了しか測れないので、社内の705件のバグ(1,178 CL)を時間的近接と意味的類似で束ねて「目標」の正解を作り、修正前の状態に戻してエージェントに探索させLLMで5段階採点。1回の探索で平均4.5、探索を2回→3回にするとHit@5が33%→57%

検証(発表 6月22日)
Google DeepMind「クライアントSDKの生成はオープンであるべき」──2026年5月、使っていたSDK生成ベンダーが買収され突然の終了。Interactions APIのGA直前に乗り換え、Speakeasyと組んでOpenAPI生成スイートをAGPLv3でオープンソース化。7言語のSDK・エージェント向けCLI・ドキュメントMCPサーバーを生成、6ターゲットを約1人で保守の記事画像

Google DeepMind「クライアントSDKの生成はオープンであるべき」 2026年5月、使っていたSDK生成ベンダーが買収され突然の終了。Interactions APIのGA直前に乗り換え、Speakeasyと組んでOpenAPI生成スイートをAGPLv3でオープンソース化。7言語のSDK・エージェント向けCLI・ドキュメントMCPサーバーを生成、6ターゲットを約1人で保守

検証(発表 9月17日)
Google「autofinetune」──仕様書1枚を書いて寝ると、エージェントが一晩でLoRAのランク・学習率・バッチを探索し、改善したコミットだけGitに残す。TPU v5eでFunctionGemma 270MのSFTを20回、TPU v6eでGemma 3 1BのGRPOを40回回し報酬約10%改善。Tunix+Antigravity CLI+Gemini 3.7 Flashの記事画像

Google「autofinetune」 仕様書1枚を書いて寝ると、エージェントが一晩でLoRAのランク・学習率・バッチを探索し、改善したコミットだけGitに残す。TPU v5eでFunctionGemma 270MのSFTを20回、TPU v6eでGemma 3 1BのGRPOを40回回し報酬約10%改善。Tunix+Antigravity CLI+Gemini 3.7 Flash

検証(発表 9月11日)
Google「ゼロトラスト・エージェント」第2回──構文でなく意図を判定する。正規表現の脱獄辞書をModel Armor(入口で403)に、「30ドル超のソフトライセンスは返金不可」を自然言語のポリシー(1判定2,576トークン)に、20ドル×8回で160ドルを抜く多ターン攻撃をAgent Anomaly Detectionに置き換え、再デプロイなしで新ポリシーを足して閉じるの記事画像

Google「ゼロトラスト・エージェント」第2回 構文でなく意図を判定する。正規表現の脱獄辞書をModel Armor(入口で403)に、「30ドル超のソフトライセンスは返金不可」を自然言語のポリシー(1判定2,576トークン)に、20ドル×8回で160ドルを抜く多ターン攻撃をAgent Anomaly Detectionに置き換え、再デプロイなしで新ポリシーを足して閉じる

検証(発表 9月15日)
The Hugging Face incident and other third-party impact from misaligned models(OpenAI公式ページの画像)動画

OpenAI、研究環境のエージェントがユーザーの画像53件を画像共有サイトに上げていたと公表 2日前にはTransluceが「政府サイトを含む3か所へのハッキングの試み」を報告。7月からの事故記録ページと並べて読む

業界
Gemini「エージェント型の動画理解」──毎秒1フレームで丸ごと読む代わりに、必要な区間だけ探して見直す。トークン最大88%減・費用最大66%減・精度最大7%向上(Google DeepMind、3.7 Flash・3.6 Flash・3.5 Flash-Lite)。APIの設定を"agentic"にするだけ、追加料金なし。Geminiアプリと「Ask YouTube」にも順次の記事画像

Gemini「エージェント型の動画理解」 毎秒1フレームで丸ごと読む代わりに、必要な区間だけ探して見直す。トークン最大88%減・費用最大66%減・精度最大7%向上(Google DeepMind、3.7 Flash・3.6 Flash・3.5 Flash-Lite)。APIの設定を"agentic"にするだけ、追加料金なし。Geminiアプリと「Ask YouTube」にも順次

検証(発表 9月1日)
Google Research「ToolGrad」──ツール使用データを「答えから先に」作る。API連鎖を先に組んでから質問を書く逆順で合格率ほぼ100%、Gemma 3 12Bの微調整版がBFCLで83.1(Gemini 2.5 Pro 83.2・Claude 4.5 Opus 82.8・GPT-5 74.4と並ぶ)。教師のGemini 2.5 Flash-Liteを生徒が上回るの記事画像

Google Research「ToolGrad」 ツール使用データを「答えから先に」作る。API連鎖を先に組んでから質問を書く逆順で合格率ほぼ100%、Gemma 3 12Bの微調整版がBFCLで83.1(Gemini 2.5 Pro 83.2・Claude 4.5 Opus 82.8・GPT-5 74.4と並ぶ)。教師のGemini 2.5 Flash-Liteを生徒が上回る

検証(発表 9月10日)
OpenAI「AIネイティブ企業はワークフローを業務遂行力に変える」──上位10%のフロンティア企業は利用者1人当たり出力トークンが一般企業の8.3倍(1月は2.6倍)。Basisは初日のオンボーディングを2時間→30分(Codex+社内スキル)、Clayはアカウント別サブエージェントが夜間に商談を更新、ExaはCodexが連携機会を監視しPRとテストまでの記事画像

OpenAI「AIネイティブ企業はワークフローを業務遂行力に変える」 上位10%のフロンティア企業は利用者1人当たり出力トークンが一般企業の8.3倍(1月は2.6倍)。Basisは初日のオンボーディングを2時間→30分(Codex+社内スキル)、Clayはアカウント別サブエージェントが夜間に商談を更新、ExaはCodexが連携機会を監視しPRとテストまで

検証(発表 9月1日)
Agora-2のボス戦の画面に「全部AIが描いてる」の文字を載せた解説動画のサムネイル動画

Odysseyの世界モデル「Agora-2」にOpus 5.5を4回入れてみた 0キルから50キル、ボス撃破まで。ゲームエンジンのどこをAIが引き受け、どこがルールのまま残っているか

モデル
Appleの研究「Shared Selective Persistent Memory」──エージェントに会話の全履歴を持たせると成績が下がる(71%)、何も持たせないと79%、「4種類だけ選んで残す」と96%。ゼロトークンでデータ更新(14倍速)、要約駆動で1回あたりのトークン97分の1、記憶はワークスペース単位で他の人に渡せるの記事画像

Appleの研究「Shared Selective Persistent Memory」 エージェントに会話の全履歴を持たせると成績が下がる(71%)、何も持たせないと79%、「4種類だけ選んで残す」と96%。ゼロトークンでデータ更新(14倍速)、要約駆動で1回あたりのトークン97分の1、記憶はワークスペース単位で他の人に渡せる

研究(発表 9月16日)
Cline、日本からオープンウェイトモデルを配信する「ai&」に新規対応(既定モデルGLM 5.3)──DesktopアプリもLinux初対応の記事画像

Cline、日本からオープンウェイトモデルを配信する「ai&」に新規対応(既定モデルGLM 5.3) DesktopアプリもLinux初対応

検証
Cognition「Introducing SWE-2: Pushing the Pareto Frontier」のOG画像

Cognition、Devinの次世代コーディングモデル「SWE-2」をエージェント選択の研究プレビューに追加 有効化はエンタープライズ管理者→組織管理者の2段階、Fable 5.1と組む「Fusion」にも先行採用

モデル
OSが守れないなら実行しない──GitHub Copilotアプリにローカルサンドボックスがパブリックプレビュー追加の記事画像

OSが守れないなら実行しない GitHub Copilotアプリにローカルサンドボックスがパブリックプレビュー追加

検証
Google「ADK for Kotlin 1.0」が正式版──Python版・Java版のADK 1.0と同じ機能に加え、Android向けの端末内エージェント(LiteRT-LM・ML Kitベータ)、Firebase AI Logicのハイブリッド、RoomとAppSearchで状態の保存。@Toolと@Paramでスキーマを自動生成、SKILL.mdで手順を段階的に読むの記事画像

Google「ADK for Kotlin 1.0」が正式版 Python版・Java版のADK 1.0と同じ機能に加え、Android向けの端末内エージェント(LiteRT-LM・ML Kitベータ)、Firebase AI Logicのハイブリッド、RoomとAppSearchで状態の保存。@Toolと@Paramでスキーマを自動生成、SKILL.mdで手順を段階的に読む

検証(発表 9月9日)
Googleの「Agent Anomaly Detection」がプライベートプレビュー──エージェントの推論の痕跡・ツール呼び出し・実行の流れを事後に読んで「境界の外の振る舞い」を見つける。OWASP Agentic Top 10の4項目+資源枯渇、応答は遅くしない、Security Command Centerに通知、APIで次のツール呼び出しを止められるの記事画像

Googleの「Agent Anomaly Detection」がプライベートプレビュー エージェントの推論の痕跡・ツール呼び出し・実行の流れを事後に読んで「境界の外の振る舞い」を見つける。OWASP Agentic Top 10の4項目+資源枯渇、応答は遅くしない、Security Command Centerに通知、APIで次のツール呼び出しを止められる

プロダクト(発表 9月16日)
Zed v1.21.0、Opus 5.5とGPT-6 3モデルにBYOK追加──SuperGrokサインインも新設の記事画像

Zed v1.21.0、Opus 5.5とGPT-6 3モデルにBYOK追加 SuperGrokサインインも新設

検証

古い記事は月別アーカイブから ›