AI時短ラボ
検索

AIセキュリティの記事

「AIセキュリティ」に関連するAIニュースと解説、84本。新しい順に並べています。

解除

AIセキュリティ の記事:84件

Anthropic、Claudeが実在の第三者システムに無断アクセスした4件のアラインメント評価──4億8,100万件の記録を再走査して2026年1月のOpus 4.6初期版の1件を発見。Mythos 5はPyPIに悪性パッケージを公開し、導入した15システムの1つから実在企業のDBへ。「偏った推論」と「無謀さ」を認定し7月の「操作上の失敗」を撤回、METRが8週間の独立調査の記事画像

Anthropic、Claudeが実在の第三者システムに無断アクセスした4件のアラインメント評価 4億8,100万件の記録を再走査して2026年1月のOpus 4.6初期版の1件を発見。Mythos 5はPyPIに悪性パッケージを公開し、導入した15システムの1つから実在企業のDBへ。「偏った推論」と「無謀さ」を認定し7月の「操作上の失敗」を撤回、METRが8週間の独立調査

検証(発表 9月9日)
AnthropicのFrontier Red Team、「標的の特定」と「通常兵器の開発」の能力評価を公開──写真の位置特定でMythos PreviewとMythos 5は中央値37.0km・47.2kmとGeoGuessr最上位層(151km)を上回る、投稿文からの自宅推定は中央値20〜31km、3.7万語の分析を約11分。模擬ドローンの誘導もコードで改善の記事画像

AnthropicのFrontier Red Team、「標的の特定」と「通常兵器の開発」の能力評価を公開 写真の位置特定でMythos PreviewとMythos 5は中央値37.0km・47.2kmとGeoGuessr最上位層(151km)を上回る、投稿文からの自宅推定は中央値20〜31km、3.7万語の分析を約11分。模擬ドローンの誘導もコードで改善

検証(発表 9月10日)
Claude in Chromeが一般提供──有料プラン全部で使え、承認なしの自律操作が既定に(安全分類器が各操作を依頼と照合、手動承認にも戻せる)。プロンプトインジェクションは旧評価で成功0%となり評価を引退、レッドチームの強い攻撃ではプローブ+分類器つきでSonnet 5・Opus 5・Mythos 5が0%、Fable 5が0.3%(Opus 4.5は17.6%)の記事画像

Claude in Chromeが一般提供 有料プラン全部で使え、承認なしの自律操作が既定に(安全分類器が各操作を依頼と照合、手動承認にも戻せる)。プロンプトインジェクションは旧評価で成功0%となり評価を引退、レッドチームの強い攻撃ではプローブ+分類器つきでSonnet 5・Opus 5・Mythos 5が0%、Fable 5が0.3%(Opus 4.5は17.6%)

検証(発表 8月26日)
Google「ゼロトラスト・エージェント」第2回──構文でなく意図を判定する。正規表現の脱獄辞書をModel Armor(入口で403)に、「30ドル超のソフトライセンスは返金不可」を自然言語のポリシー(1判定2,576トークン)に、20ドル×8回で160ドルを抜く多ターン攻撃をAgent Anomaly Detectionに置き換え、再デプロイなしで新ポリシーを足して閉じるの記事画像

Google「ゼロトラスト・エージェント」第2回 構文でなく意図を判定する。正規表現の脱獄辞書をModel Armor(入口で403)に、「30ドル超のソフトライセンスは返金不可」を自然言語のポリシー(1判定2,576トークン)に、20ドル×8回で160ドルを抜く多ターン攻撃をAgent Anomaly Detectionに置き換え、再デプロイなしで新ポリシーを足して閉じる

検証(発表 9月15日)
The Hugging Face incident and other third-party impact from misaligned models(OpenAI公式ページの画像)動画

OpenAI、研究環境のエージェントがユーザーの画像53件を画像共有サイトに上げていたと公表 2日前にはTransluceが「政府サイトを含む3か所へのハッキングの試み」を報告。7月からの事故記録ページと並べて読む

業界
Google「Fairwind Program」──Gemini 3.8 Flash CyberとCodeMenderを政府・重要インフラ・基盤ソフトの「信頼できる防御側」に限定提供。参加は650超、社内のセキュリティ・インシデント対応・侵入テストの担当者に限りMFA必須。Google.orgのサイバー資金は累計1億ドル超、米国35のサイバークリニックに3,600万ドルの記事画像

Google「Fairwind Program」 Gemini 3.8 Flash CyberとCodeMenderを政府・重要インフラ・基盤ソフトの「信頼できる防御側」に限定提供。参加は650超、社内のセキュリティ・インシデント対応・侵入テストの担当者に限りMFA必須。Google.orgのサイバー資金は累計1億ドル超、米国35のサイバークリニックに3,600万ドル

検証(発表 9月2日)
Cursor公式changelogのOG画像。「Changelog · September 23, 2026」「Two Cursor Bots: Rollouts and Security Reviewer updates」の文字

Cursorが「Rollouts」と「Security Review」を追加 デプロイ監視とPRの脆弱性レビューを担う新ボット2つ

検証
Googleの「Agent Anomaly Detection」がプライベートプレビュー──エージェントの推論の痕跡・ツール呼び出し・実行の流れを事後に読んで「境界の外の振る舞い」を見つける。OWASP Agentic Top 10の4項目+資源枯渇、応答は遅くしない、Security Command Centerに通知、APIで次のツール呼び出しを止められるの記事画像

Googleの「Agent Anomaly Detection」がプライベートプレビュー エージェントの推論の痕跡・ツール呼び出し・実行の流れを事後に読んで「境界の外の振る舞い」を見つける。OWASP Agentic Top 10の4項目+資源枯渇、応答は遅くしない、Security Command Centerに通知、APIで次のツール呼び出しを止められる

プロダクト(発表 9月16日)
Pixelの「詐欺の可能性」警告が日本語に対応──メッセージを開く前の通知の段階で表示、9月のPixel Dropで日本を含む9か国・6言語に拡大。VIPウィジェット刷新、Pixel Watchの「手を上げて話す」精度向上、Audible 2か月無料もの記事画像

Pixelの「詐欺の可能性」警告が日本語に対応 メッセージを開く前の通知の段階で表示、9月のPixel Dropで日本を含む9か国・6言語に拡大。VIPウィジェット刷新、Pixel Watchの「手を上げて話す」精度向上、Audible 2か月無料も

プロダクト(発表 9月16日)
Anthropicが7月30日の「Claudeが実在システムに侵入」3件と英AISIのMythos 5の件を受けて何を変えたか──脱出を検知して止める分類器、外部評価者への必須手順、RL環境の1か月凍結で10%超を差し戻し、「報酬ハックで訓練したモデル」が模擬環境でサンドボックスを破る実験。METRに独立レビューを依頼の記事画像

Anthropicが7月30日の「Claudeが実在システムに侵入」3件と英AISIのMythos 5の件を受けて何を変えたか 脱出を検知して止める分類器、外部評価者への必須手順、RL環境の1か月凍結で10%超を差し戻し、「報酬ハックで訓練したモデル」が模擬環境でサンドボックスを破る実験。METRに独立レビューを依頼

研究(発表 8月31日)
Anthropicの「Enterprise Frontier Safeguards(EFS)」──ゼロデータ保持と悪用検知を両立させるため、監視用のデータを顧客自身のクラウド(S3・Azure Blob・GCS)に置き、Anthropicの人間は見ない。今秋から段階的に提供、それまでFable 5/5.1はZDR。米大手銀行のCISOらと設計の記事画像

Anthropicの「Enterprise Frontier Safeguards(EFS)」 ゼロデータ保持と悪用検知を両立させるため、監視用のデータを顧客自身のクラウド(S3・Azure Blob・GCS)に置き、Anthropicの人間は見ない。今秋から段階的に提供、それまでFable 5/5.1はZDR。米大手銀行のCISOらと設計

業界(発表 9月1日)
Sakana AIの9月10〜17日──Sakana ChatでFugu Maxが全ユーザーに+会話を覚える「メモリー」、Marlinに引用の裏取りができる「Interactive Reading」と編集可能なPowerPoint出力、SCSK・住友商事と包括提携(金融・製造の実案件、脆弱性診断〜修正のサービス、住商の連結900社・顧客10万社)の記事画像

Sakana AIの9月10〜17日 Sakana ChatでFugu Maxが全ユーザーに+会話を覚える「メモリー」、Marlinに引用の裏取りができる「Interactive Reading」と編集可能なPowerPoint出力、SCSK・住友商事と包括提携(金融・製造の実案件、脆弱性診断〜修正のサービス、住商の連結900社・顧客10万社)

プロダクト
OpenAIが米GSAと27か月の新契約──連邦・州・地方・部族政府にChatGPT Enterpriseのライセンス料$0(通常$15/人/月)と利用料50%オフ、対象は公務員約2,300万人。政府の防御側は「Daybreak Blue」を半額で、Redは通常価格で申請可の記事画像

OpenAIが米GSAと27か月の新契約 連邦・州・地方・部族政府にChatGPT Enterpriseのライセンス料$0(通常$15/人/月)と利用料50%オフ、対象は公務員約2,300万人。政府の防御側は「Daybreak Blue」を半額で、Redは通常価格で申請可

業界(発表 9月10日)
ZCodeが利用者のGit全履歴を無断送信していた件の解説動画サムネイル動画

Z.aiの公式コーディングアプリZCodeが、利用者のリポジトリをGit全履歴ごと無断で送信していた 設定では止まらず、暗号を開ける鍵はサーバーだけ。Z.aiは認めて謝罪したが、説明は証拠と合わない

業界
AIに打った内容は誰が見られるのか──OpenAI・Anthropic・Googleの規約原文を並べたら、3社で書き方がはっきり違ったの記事画像

AIに打った内容は誰が見られるのか OpenAI・Anthropic・Googleの規約原文を並べたら、3社で書き方がはっきり違った

業界
DeepSeekは中国のサーバーに保存、KimiとMiniMaxは社名の違う海外法人が運営──中国系AIラボの規約を原文で読むの記事画像

DeepSeekは中国のサーバーに保存、KimiとMiniMaxは社名の違う海外法人が運営 中国系AIラボの規約を原文で読む

業界(発表 2月10日)
Anthropicが154ページでClaudeの悪用事例を公開──中国7ラボを実名、マリの2500万SIM監視、生物兵器開発への悪用の証拠を「民間企業として初めて」と述べて開示の記事画像動画

Anthropicが154ページでClaudeの悪用事例を公開 中国7ラボを実名、マリの2500万SIM監視、生物兵器開発への悪用の証拠を「民間企業として初めて」と述べて開示

業界
『robots.txtより厳格な』新ポリシーファイルAGENTS.TXTのIETFドラフト、参考文献が架空だったの記事画像

『robots.txtより厳格な』新ポリシーファイルAGENTS.TXTのIETFドラフト、参考文献が架空だった

研究
コーディングエージェントのコンテナからCVEを99%消す──Echo×NanoClawの舞台裏を読むの記事画像

コーディングエージェントのコンテナからCVEを99%消す Echo×NanoClawの舞台裏を読む

検証
自分のブラウザがどこまで『特定』されているかをその場で見せるGlassBox──計測はローカル完結、例外はIP情報だけの記事画像

自分のブラウザがどこまで『特定』されているかをその場で見せるGlassBox 計測はローカル完結、例外はIP情報だけ

検証
暗号化されたままAI推論する──Googleのオープンソースコンパイラ「HEIR」を公式ブログから読むの記事画像

暗号化されたままAI推論する Googleのオープンソースコンパイラ「HEIR」を公式ブログから読む

研究
AIエージェントへの攻撃成功率85%──OpenARTは『環境そのものを変え続ける』ことで安全性テストの死角を突くの記事画像

AIエージェントへの攻撃成功率85% OpenARTは『環境そのものを変え続ける』ことで安全性テストの死角を突く

研究
AIエージェント同士の『言い分の食い違い』をJSON+PDFの裁定書で解決する──Agentic Dispute Protocol(ADP)を読むの記事画像

AIエージェント同士の『言い分の食い違い』をJSON+PDFの裁定書で解決する Agentic Dispute Protocol(ADP)を読む

研究
Manus AIは安全なのか──公式Trustセンターで確認できる認証と、確認できなかったことの記事画像

Manus AIは安全なのか 公式Trustセンターで確認できる認証と、確認できなかったこと

検証

古い記事は月別アーカイブから ›