AIセキュリティの記事
「AIセキュリティ」に関連するAIニュースと解説、84本。新しい順に並べています。
AIセキュリティ の記事:84件
Anthropic、Claudeが実在の第三者システムに無断アクセスした4件のアラインメント評価 4億8,100万件の記録を再走査して2026年1月のOpus 4.6初期版の1件を発見。Mythos 5はPyPIに悪性パッケージを公開し、導入した15システムの1つから実在企業のDBへ。「偏った推論」と「無謀さ」を認定し7月の「操作上の失敗」を撤回、METRが8週間の独立調査
Anthropic、Claudeが実在の第三者システムに無断アクセスした4件のアラインメント評価4億8,100万件の記録を再走査して2026年1月のOpus 4.6初期版の1件を発見。Mythos 5はPyPIに悪性パッケージを公開し、導入した15システムの1つから実在企業のDBへ。「偏った推論」と「無謀さ」を認定し7月の「操作上の失敗」を撤回、METRが8週間の独立調査
検証
AnthropicのFrontier Red Team、「標的の特定」と「通常兵器の開発」の能力評価を公開 写真の位置特定でMythos PreviewとMythos 5は中央値37.0km・47.2kmとGeoGuessr最上位層(151km)を上回る、投稿文からの自宅推定は中央値20〜31km、3.7万語の分析を約11分。模擬ドローンの誘導もコードで改善
AnthropicのFrontier Red Team、「標的の特定」と「通常兵器の開発」の能力評価を公開写真の位置特定でMythos PreviewとMythos 5は中央値37.0km・47.2kmとGeoGuessr最上位層(151km)を上回る、投稿文からの自宅推定は中央値20〜31km、3.7万語の分析を約11分。模擬ドローンの誘導もコードで改善
検証
Claude in Chromeが一般提供 有料プラン全部で使え、承認なしの自律操作が既定に(安全分類器が各操作を依頼と照合、手動承認にも戻せる)。プロンプトインジェクションは旧評価で成功0%となり評価を引退、レッドチームの強い攻撃ではプローブ+分類器つきでSonnet 5・Opus 5・Mythos 5が0%、Fable 5が0.3%(Opus 4.5は17.6%)
Claude in Chromeが一般提供有料プラン全部で使え、承認なしの自律操作が既定に(安全分類器が各操作を依頼と照合、手動承認にも戻せる)。プロンプトインジェクションは旧評価で成功0%となり評価を引退、レッドチームの強い攻撃ではプローブ+分類器つきでSonnet 5・Opus 5・Mythos 5が0%、Fable 5が0.3%(Opus 4.5は17.6%)
検証
Google「ゼロトラスト・エージェント」第2回 構文でなく意図を判定する。正規表現の脱獄辞書をModel Armor(入口で403)に、「30ドル超のソフトライセンスは返金不可」を自然言語のポリシー(1判定2,576トークン)に、20ドル×8回で160ドルを抜く多ターン攻撃をAgent Anomaly Detectionに置き換え、再デプロイなしで新ポリシーを足して閉じる
Google「ゼロトラスト・エージェント」第2回構文でなく意図を判定する。正規表現の脱獄辞書をModel Armor(入口で403)に、「30ドル超のソフトライセンスは返金不可」を自然言語のポリシー(1判定2,576トークン)に、20ドル×8回で160ドルを抜く多ターン攻撃をAgent Anomaly Detectionに置き換え、再デプロイなしで新ポリシーを足して閉じる
検証
OpenAI、研究環境のエージェントがユーザーの画像53件を画像共有サイトに上げていたと公表 2日前にはTransluceが「政府サイトを含む3か所へのハッキングの試み」を報告。7月からの事故記録ページと並べて読む
OpenAI、研究環境のエージェントがユーザーの画像53件を画像共有サイトに上げていたと公表2日前にはTransluceが「政府サイトを含む3か所へのハッキングの試み」を報告。7月からの事故記録ページと並べて読む
業界
Google「Fairwind Program」 Gemini 3.8 Flash CyberとCodeMenderを政府・重要インフラ・基盤ソフトの「信頼できる防御側」に限定提供。参加は650超、社内のセキュリティ・インシデント対応・侵入テストの担当者に限りMFA必須。Google.orgのサイバー資金は累計1億ドル超、米国35のサイバークリニックに3,600万ドル
Google「Fairwind Program」Gemini 3.8 Flash CyberとCodeMenderを政府・重要インフラ・基盤ソフトの「信頼できる防御側」に限定提供。参加は650超、社内のセキュリティ・インシデント対応・侵入テストの担当者に限りMFA必須。Google.orgのサイバー資金は累計1億ドル超、米国35のサイバークリニックに3,600万ドル
検証
Cursorが「Rollouts」と「Security Review」を追加 デプロイ監視とPRの脆弱性レビューを担う新ボット2つ
Cursorが「Rollouts」と「Security Review」を追加デプロイ監視とPRの脆弱性レビューを担う新ボット2つ
検証
Googleの「Agent Anomaly Detection」がプライベートプレビュー エージェントの推論の痕跡・ツール呼び出し・実行の流れを事後に読んで「境界の外の振る舞い」を見つける。OWASP Agentic Top 10の4項目+資源枯渇、応答は遅くしない、Security Command Centerに通知、APIで次のツール呼び出しを止められる
Googleの「Agent Anomaly Detection」がプライベートプレビューエージェントの推論の痕跡・ツール呼び出し・実行の流れを事後に読んで「境界の外の振る舞い」を見つける。OWASP Agentic Top 10の4項目+資源枯渇、応答は遅くしない、Security Command Centerに通知、APIで次のツール呼び出しを止められる
プロダクト
Pixelの「詐欺の可能性」警告が日本語に対応 メッセージを開く前の通知の段階で表示、9月のPixel Dropで日本を含む9か国・6言語に拡大。VIPウィジェット刷新、Pixel Watchの「手を上げて話す」精度向上、Audible 2か月無料も
Pixelの「詐欺の可能性」警告が日本語に対応メッセージを開く前の通知の段階で表示、9月のPixel Dropで日本を含む9か国・6言語に拡大。VIPウィジェット刷新、Pixel Watchの「手を上げて話す」精度向上、Audible 2か月無料も
プロダクト
Anthropicが7月30日の「Claudeが実在システムに侵入」3件と英AISIのMythos 5の件を受けて何を変えたか 脱出を検知して止める分類器、外部評価者への必須手順、RL環境の1か月凍結で10%超を差し戻し、「報酬ハックで訓練したモデル」が模擬環境でサンドボックスを破る実験。METRに独立レビューを依頼
Anthropicが7月30日の「Claudeが実在システムに侵入」3件と英AISIのMythos 5の件を受けて何を変えたか脱出を検知して止める分類器、外部評価者への必須手順、RL環境の1か月凍結で10%超を差し戻し、「報酬ハックで訓練したモデル」が模擬環境でサンドボックスを破る実験。METRに独立レビューを依頼
研究
Anthropicの「Enterprise Frontier Safeguards(EFS)」 ゼロデータ保持と悪用検知を両立させるため、監視用のデータを顧客自身のクラウド(S3・Azure Blob・GCS)に置き、Anthropicの人間は見ない。今秋から段階的に提供、それまでFable 5/5.1はZDR。米大手銀行のCISOらと設計
Anthropicの「Enterprise Frontier Safeguards(EFS)」ゼロデータ保持と悪用検知を両立させるため、監視用のデータを顧客自身のクラウド(S3・Azure Blob・GCS)に置き、Anthropicの人間は見ない。今秋から段階的に提供、それまでFable 5/5.1はZDR。米大手銀行のCISOらと設計
業界
Sakana AIの9月10〜17日 Sakana ChatでFugu Maxが全ユーザーに+会話を覚える「メモリー」、Marlinに引用の裏取りができる「Interactive Reading」と編集可能なPowerPoint出力、SCSK・住友商事と包括提携(金融・製造の実案件、脆弱性診断〜修正のサービス、住商の連結900社・顧客10万社)
Sakana AIの9月10〜17日Sakana ChatでFugu Maxが全ユーザーに+会話を覚える「メモリー」、Marlinに引用の裏取りができる「Interactive Reading」と編集可能なPowerPoint出力、SCSK・住友商事と包括提携(金融・製造の実案件、脆弱性診断〜修正のサービス、住商の連結900社・顧客10万社)
プロダクト
OpenAIが米GSAと27か月の新契約 連邦・州・地方・部族政府にChatGPT Enterpriseのライセンス料$0(通常$15/人/月)と利用料50%オフ、対象は公務員約2,300万人。政府の防御側は「Daybreak Blue」を半額で、Redは通常価格で申請可
OpenAIが米GSAと27か月の新契約連邦・州・地方・部族政府にChatGPT Enterpriseのライセンス料$0(通常$15/人/月)と利用料50%オフ、対象は公務員約2,300万人。政府の防御側は「Daybreak Blue」を半額で、Redは通常価格で申請可
業界
Z.aiの公式コーディングアプリZCodeが、利用者のリポジトリをGit全履歴ごと無断で送信していた 設定では止まらず、暗号を開ける鍵はサーバーだけ。Z.aiは認めて謝罪したが、説明は証拠と合わない
Z.aiの公式コーディングアプリZCodeが、利用者のリポジトリをGit全履歴ごと無断で送信していた設定では止まらず、暗号を開ける鍵はサーバーだけ。Z.aiは認めて謝罪したが、説明は証拠と合わない
業界
AIに打った内容は誰が見られるのか OpenAI・Anthropic・Googleの規約原文を並べたら、3社で書き方がはっきり違った
AIに打った内容は誰が見られるのかOpenAI・Anthropic・Googleの規約原文を並べたら、3社で書き方がはっきり違った
業界
DeepSeekは中国のサーバーに保存、KimiとMiniMaxは社名の違う海外法人が運営 中国系AIラボの規約を原文で読む
DeepSeekは中国のサーバーに保存、KimiとMiniMaxは社名の違う海外法人が運営中国系AIラボの規約を原文で読む
業界
Anthropicが154ページでClaudeの悪用事例を公開 中国7ラボを実名、マリの2500万SIM監視、生物兵器開発への悪用の証拠を「民間企業として初めて」と述べて開示
Anthropicが154ページでClaudeの悪用事例を公開中国7ラボを実名、マリの2500万SIM監視、生物兵器開発への悪用の証拠を「民間企業として初めて」と述べて開示
業界
『robots.txtより厳格な』新ポリシーファイルAGENTS.TXTのIETFドラフト、参考文献が架空だった
『robots.txtより厳格な』新ポリシーファイルAGENTS.TXTのIETFドラフト、参考文献が架空だった
研究
コーディングエージェントのコンテナからCVEを99%消す Echo×NanoClawの舞台裏を読む
コーディングエージェントのコンテナからCVEを99%消すEcho×NanoClawの舞台裏を読む
検証
自分のブラウザがどこまで『特定』されているかをその場で見せるGlassBox 計測はローカル完結、例外はIP情報だけ
自分のブラウザがどこまで『特定』されているかをその場で見せるGlassBox計測はローカル完結、例外はIP情報だけ
検証
暗号化されたままAI推論する Googleのオープンソースコンパイラ「HEIR」を公式ブログから読む
暗号化されたままAI推論するGoogleのオープンソースコンパイラ「HEIR」を公式ブログから読む
研究
AIエージェントへの攻撃成功率85% OpenARTは『環境そのものを変え続ける』ことで安全性テストの死角を突く
AIエージェントへの攻撃成功率85%OpenARTは『環境そのものを変え続ける』ことで安全性テストの死角を突く
研究
AIエージェント同士の『言い分の食い違い』をJSON+PDFの裁定書で解決する Agentic Dispute Protocol(ADP)を読む
AIエージェント同士の『言い分の食い違い』をJSON+PDFの裁定書で解決するAgentic Dispute Protocol(ADP)を読む
研究
Manus AIは安全なのか 公式Trustセンターで確認できる認証と、確認できなかったこと
Manus AIは安全なのか公式Trustセンターで確認できる認証と、確認できなかったこと
検証