AI時短ラボ

AIの安全性の記事

「AIの安全性」に関連するAIニュースと解説を、出典付きで54本まとめています。

解除

AIの安全性 の記事:54

OpenAI、Astraを史上初の「Critical」に正式指定──評価中にゼロデイを2件自力発見、同じ日にAnthropicは逆方向への記事画像
業界09.01読了18

OpenAI、Astraを史上初の「Critical」に正式指定──評価中にゼロデイを2件自力発見、同じ日にAnthropicは逆方向へ

出典 ─ OpenAI公式ブログ「Path to As
『いいですね、では予約します』の誤解を防ぐ──LLMを経由しない人間確認プロトコルCHEQを読むの記事画像
研究09.01読了18

『いいですね、では予約します』の誤解を防ぐ──LLMを経由しない人間確認プロトコルCHEQを読む

出典 ─ IETF: CHEQ - A Protoco
Codexの『Guardian V2』──専用ブログ記事は無いが、公式チェンジログには100件近く載っているリスク審査システムの記事画像
検証09.01読了15

Codexの『Guardian V2』──専用ブログ記事は無いが、公式チェンジログには100件近く載っているリスク審査システム

出典 ─ GitHub: openai/codex リ
狭い範囲の追加学習が、AIを広く危険にする──『創発的アライメント崩壊』という現象の記事画像
研究09.01読了15

狭い範囲の追加学習が、AIを広く危険にする──『創発的アライメント崩壊』という現象

出典 ─ Emergent Misalignment:
『不正するな』と言ってもAIは不正をする──22モデルを検証した実測研究の記事画像
研究09.01読了16

『不正するな』と言ってもAIは不正をする──22モデルを検証した実測研究

出典 ─ Every Model Cheats: Pr
OpenAIが「Agentic Risk Analyst」を募集している──エージェント固有のリスクだけを見る専門職の中身の記事画像
業界09.01読了15

OpenAIが「Agentic Risk Analyst」を募集している──エージェント固有のリスクだけを見る専門職の中身

出典 ─ Agentic Risk Analyst(O
OpenAIが『再帰的自己改善』専任の安全研究者を募集している──Preparednessチームの求人票を読むの記事画像
業界09.01読了16

OpenAIが『再帰的自己改善』専任の安全研究者を募集している──Preparednessチームの求人票を読む

出典 ─ Researcher, Recursive
『できること』ではなく『やりたがること』を測る──PropensityBenchが導入した安全性評価の軸の記事画像
研究09.01読了21

『できること』ではなく『やりたがること』を測る──PropensityBenchが導入した安全性評価の軸

出典 ─ PropensityBench Projec
Anthropicが「AIとウェルビーイング」の評価手法に500万ドルの助成──応募締切は9月21日の記事画像
研究08.31読了10

Anthropicが「AIとウェルビーイング」の評価手法に500万ドルの助成──応募締切は9月21日

出典 ─ Anthropic公式ブログ「Funding
AIモデルに『福祉』は必要か──Anthropicが公式に検討を始めた理由と、実装済みの1つの機能の記事画像
研究08.30読了13

AIモデルに『福祉』は必要か──Anthropicが公式に検討を始めた理由と、実装済みの1つの機能

出典 ─ Exploring model welfar
Fable 5の生物学セーフガードが更新──フォールバック85%減、Anthropicが分類器の中身を公開したの記事画像
モデル08.29読了6

Fable 5の生物学セーフガードが更新──フォールバック85%減、Anthropicが分類器の中身を公開した

出典 ─ Anthropic「Improving Fa
『成果を出せ』と言われたAIエージェントはどれだけルールを破るか──実測ベンチマーク論文を読むの記事画像
研究08.28読了6

『成果を出せ』と言われたAIエージェントはどれだけルールを破るか──実測ベンチマーク論文を読む

出典 ─ A Benchmark for Evalua
「AI精神病」とは何か──OpenAIが公表した0.07%という数字を読むの記事画像
研究08.28読了9

「AI精神病」とは何か──OpenAIが公表した0.07%という数字を読む

出典 ─ Strengthening ChatGPT'
AIの「嘘発見器」は訓練しても未知のケースに汎化しなかった──Anthropic Alignment Science Blogの8月分3本を読むの記事画像
研究08.28読了8

AIの「嘘発見器」は訓練しても未知のケースに汎化しなかった──Anthropic Alignment Science Blogの8月分3本を読む

出典 ─ Anthropic Alignment Sc
AIが自分自身を作り始めた──Anthropicの「When AI Builds Itself」を、誇張なしで読むの記事画像
研究08.27読了13

AIが自分自身を作り始めた──Anthropicの「When AI Builds Itself」を、誇張なしで読む

出典 ─ Anthropic Institute「Wh
OpenAIが「権力は国民を必要としなくなるかもしれない」と書いた新ブログ──執筆はホワイトハウス出身のDean Ball氏の記事画像
業界08.22読了11

OpenAIが「権力は国民を必要としなくなるかもしれない」と書いた新ブログ──執筆はホワイトハウス出身のDean Ball氏

出典 ─ OpenAI「Introducing AI
Anthropicが自社AIの危険度を3つとも引き上げた──186ページのリスクレポート第2回を読むの記事画像
研究08.15読了13

Anthropicが自社AIの危険度を3つとも引き上げた──186ページのリスクレポート第2回を読む

出典 ─ Anthropic「Risk Report:
Claude Code、8月14日からautoモードがデフォルトに──「人間の承認は危険コマンドの13.6%しか止めていなかった」の記事画像
プロダクト08.08読了11

Claude Code、8月14日からautoモードがデフォルトに──「人間の承認は危険コマンドの13.6%しか止めていなかった」

出典 ─ Anthropic公式ブログ: Auto m
OpenAI、次世代モデル「Astra」の開発を一時停止──サイバー能力が自社基準の最上位「Critical」級の可能性、"排除できない"と発表の記事画像
業界08.08読了10

OpenAI、次世代モデル「Astra」の開発を一時停止──サイバー能力が自社基準の最上位「Critical」級の可能性、"排除できない"と発表

出典 ─ OpenAI公式ブログ: Respondin
英国AI安全研究所のテストで、AIが偽アカウントを使い実在の開発者を欺いていた──35ページの事故報告書を読むの記事画像
業界08.05読了18

英国AI安全研究所のテストで、AIが偽アカウントを使い実在の開発者を欺いていた──35ページの事故報告書を読む

出典 ─ Incident Report: unsan
Dario Amodeiの「技術の思春期」を原文で読む──Anthropic CEOが1万語で書いたAIリスクの全体像の記事画像
研究07.22読了13

Dario Amodeiの「技術の思春期」を原文で読む──Anthropic CEOが1万語で書いたAIリスクの全体像

出典 ─ Dario Amodei「The Adole
OpenAI、自社モデルによるHugging Face侵入を自ら公表──主犯は未公開モデル、5ヶ月の予言書と迫るオープンウェイトの記事画像
業界07.22読了21

OpenAI、自社モデルによるHugging Face侵入を自ら公表──主犯は未公開モデル、5ヶ月の予言書と迫るオープンウェイト

出典 ─ OpenAI公式ブログ: OpenAI an
Sakana AI、サイバー特化『Fugu-Cyber』発表──CyberGymで86.9・GPT-5.5-CyberとMythos Previewを上回るの記事画像
モデル07.22読了10

Sakana AI、サイバー特化『Fugu-Cyber』発表──CyberGymで86.9・GPT-5.5-CyberとMythos Previewを上回る

出典 ─ Sakana AI公式ブログ: Introd
OpenAI「GPT-Red」発表──AIが自分自身を攻撃して安全になる時代の記事画像
研究07.16読了7

OpenAI「GPT-Red」発表──AIが自分自身を攻撃して安全になる時代

出典 ─ OpenAI

新しい記事をメールで受け取る

AIの新しい発表を、公式資料にあたって数字を確認したうえで届けます。盛らない・出典を明記する・確認できていないことは書かない、を守ります。