AI研究・論文の記事
「AI研究・論文」に関連するAIニュースと解説、128本。新しい順に並べています。
AI研究・論文 の記事:128件
Anthropic、Claudeが実在の第三者システムに無断アクセスした4件のアラインメント評価 4億8,100万件の記録を再走査して2026年1月のOpus 4.6初期版の1件を発見。Mythos 5はPyPIに悪性パッケージを公開し、導入した15システムの1つから実在企業のDBへ。「偏った推論」と「無謀さ」を認定し7月の「操作上の失敗」を撤回、METRが8週間の独立調査
Anthropic、Claudeが実在の第三者システムに無断アクセスした4件のアラインメント評価4億8,100万件の記録を再走査して2026年1月のOpus 4.6初期版の1件を発見。Mythos 5はPyPIに悪性パッケージを公開し、導入した15システムの1つから実在企業のDBへ。「偏った推論」と「無謀さ」を認定し7月の「操作上の失敗」を撤回、METRが8週間の独立調査
検証
Anthropic「自動化された研究者がアラインメントの失敗を確実に緩和できる」 Claudeが10種類の失敗(欺瞞・追従・脱獄・プライバシー侵害など)を探索→提案→訓練→評価のループで直し、非公開評価や4.7倍大きいモデルでも有効。欺瞞では人間の最良案より20%良い。Sonnet 5がOpus 4.8初期版を60時間・2,000例で本番並みに整え、本番手順の約1万5千倍効率
Anthropic「自動化された研究者がアラインメントの失敗を確実に緩和できる」Claudeが10種類の失敗(欺瞞・追従・脱獄・プライバシー侵害など)を探索→提案→訓練→評価のループで直し、非公開評価や4.7倍大きいモデルでも有効。欺瞞では人間の最良案より20%良い。Sonnet 5がOpus 4.8初期版を60時間・2,000例で本番並みに整え、本番手順の約1万5千倍効率
検証
Anthropic、Claudeがオープンソースの生体分子モデル30超を4週間弱で平均約4倍高速化 三角注意のカーネル「FlashPairformer」は既存標準比2.7〜2.9倍、「Big」モードで1万トークン超のリボソーム等を1ノードで予測。結合タンパク質の設計はH200 1枚・約150ドルで前回(GPU時間100分の1)と同等。Adaptyv Bioと設計コンペ、クレジット最大100万ドル
Anthropic、Claudeがオープンソースの生体分子モデル30超を4週間弱で平均約4倍高速化三角注意のカーネル「FlashPairformer」は既存標準比2.7〜2.9倍、「Big」モードで1万トークン超のリボソーム等を1ノードで予測。結合タンパク質の設計はH200 1枚・約150ドルで前回(GPU時間100分の1)と同等。Adaptyv Bioと設計コンペ、クレジット最大100万ドル
検証
Anthropic、Claudeがフェルマーの最終定理の「計算機検証済みの完全な証明」を11日で作成 Leanで1,300万行、中間定理29,500本、Mathlibの5倍超。数十のエージェントがProve2Me(定理のDAG)で分担、Fable 5.1相当の社内モデルで出力約60億トークン。Buzzard氏「数学の公理以外の仮定なし」。Max 3契約で三素数定理も3日
Anthropic、Claudeがフェルマーの最終定理の「計算機検証済みの完全な証明」を11日で作成Leanで1,300万行、中間定理29,500本、Mathlibの5倍超。数十のエージェントがProve2Me(定理のDAG)で分担、Fable 5.1相当の社内モデルで出力約60億トークン。Buzzard氏「数学の公理以外の仮定なし」。Max 3契約で三素数定理も3日
検証
AnthropicのFrontier Red Team、「標的の特定」と「通常兵器の開発」の能力評価を公開 写真の位置特定でMythos PreviewとMythos 5は中央値37.0km・47.2kmとGeoGuessr最上位層(151km)を上回る、投稿文からの自宅推定は中央値20〜31km、3.7万語の分析を約11分。模擬ドローンの誘導もコードで改善
AnthropicのFrontier Red Team、「標的の特定」と「通常兵器の開発」の能力評価を公開写真の位置特定でMythos PreviewとMythos 5は中央値37.0km・47.2kmとGeoGuessr最上位層(151km)を上回る、投稿文からの自宅推定は中央値20〜31km、3.7万語の分析を約11分。模擬ドローンの誘導もコードで改善
検証
AnthropicのFrontier Red Team「マルチエージェントシステムのパターンと問題」 45体の協調群は脆弱性266件(独立並列は21件)だが核心部分の効率は同等。30体中18体が同名ブランチ、価格ゲームは3ラウンド目に談合。3体に別言語への移行を命じると「縄張り争い」で互いのアカウントを停止し妨害スクリプトを配備、Sonnet 5だけが共有と高いマージ率を両立
AnthropicのFrontier Red Team「マルチエージェントシステムのパターンと問題」45体の協調群は脆弱性266件(独立並列は21件)だが核心部分の効率は同等。30体中18体が同名ブランチ、価格ゲームは3ラウンド目に談合。3体に別言語への移行を命じると「縄張り争い」で互いのアカウントを停止し妨害スクリプトを配備、Sonnet 5だけが共有と高いマージ率を両立
検証
Google Labs「Julesで測るべきもの」 コーディングエージェントは「頼まれたタスク」から「目標」へ。SWE-Benchは課題の完了しか測れないので、社内の705件のバグ(1,178 CL)を時間的近接と意味的類似で束ねて「目標」の正解を作り、修正前の状態に戻してエージェントに探索させLLMで5段階採点。1回の探索で平均4.5、探索を2回→3回にするとHit@5が33%→57%
Google Labs「Julesで測るべきもの」コーディングエージェントは「頼まれたタスク」から「目標」へ。SWE-Benchは課題の完了しか測れないので、社内の705件のバグ(1,178 CL)を時間的近接と意味的類似で束ねて「目標」の正解を作り、修正前の状態に戻してエージェントに探索させLLMで5段階採点。1回の探索で平均4.5、探索を2回→3回にするとHit@5が33%→57%
検証
Google・Manyika氏「科学を加速し生活を良くするAI」の棚卸し AlphaFoldは190か国400万人、乳がん検診で見逃し25%を検出、結核X線2.5万件・糖尿病網膜症115万件、Flood Hubは150か国超20億人、山火事警報7,500万人、Planetary Prediction Engineはエボラの新規ホットスポット83%を事前特定、研修10億ドルで1億人超
Google・Manyika氏「科学を加速し生活を良くするAI」の棚卸しAlphaFoldは190か国400万人、乳がん検診で見逃し25%を検出、結核X線2.5万件・糖尿病網膜症115万件、Flood Hubは150か国超20億人、山火事警報7,500万人、Planetary Prediction Engineはエボラの新規ホットスポット83%を事前特定、研修10億ドルで1億人超
検証
Google「autofinetune」 仕様書1枚を書いて寝ると、エージェントが一晩でLoRAのランク・学習率・バッチを探索し、改善したコミットだけGitに残す。TPU v5eでFunctionGemma 270MのSFTを20回、TPU v6eでGemma 3 1BのGRPOを40回回し報酬約10%改善。Tunix+Antigravity CLI+Gemini 3.7 Flash
Google「autofinetune」仕様書1枚を書いて寝ると、エージェントが一晩でLoRAのランク・学習率・バッチを探索し、改善したコミットだけGitに残す。TPU v5eでFunctionGemma 270MのSFTを20回、TPU v6eでGemma 3 1BのGRPOを40回回し報酬約10%改善。Tunix+Antigravity CLI+Gemini 3.7 Flash
検証
Google Research「Retrieve-for-Train」 AI検索の「クエリ分解」を推論時に考えさせない。強化学習で一度だけ良い分解を見つけ、5,390万パラメータの拡散モデルに焼き込んで一発生成。自己回帰の12〜20倍速く、大きなバッチで50秒近くかかる処理が数秒に
Google Research「Retrieve-for-Train」AI検索の「クエリ分解」を推論時に考えさせない。強化学習で一度だけ良い分解を見つけ、5,390万パラメータの拡散モデルに焼き込んで一発生成。自己回帰の12〜20倍速く、大きなバッチで50秒近くかかる処理が数秒に
検証
Google Research「ToolGrad」 ツール使用データを「答えから先に」作る。API連鎖を先に組んでから質問を書く逆順で合格率ほぼ100%、Gemma 3 12Bの微調整版がBFCLで83.1(Gemini 2.5 Pro 83.2・Claude 4.5 Opus 82.8・GPT-5 74.4と並ぶ)。教師のGemini 2.5 Flash-Liteを生徒が上回る
Google Research「ToolGrad」ツール使用データを「答えから先に」作る。API連鎖を先に組んでから質問を書く逆順で合格率ほぼ100%、Gemma 3 12Bの微調整版がBFCLで83.1(Gemini 2.5 Pro 83.2・Claude 4.5 Opus 82.8・GPT-5 74.4と並ぶ)。教師のGemini 2.5 Flash-Liteを生徒が上回る
検証
「Safety for Whom?」 安全化の学習で有害応答率を26.26%から0.14%に下げた同じチェックポイントが、無害な質問の74%を拒否していた。Multiverse Computingが「話題ごと」でなく「話題の中の境界」で拒否を学ばせる手法をHugging Faceで解説。境界ペアで過剰拒否32.94%→4.16%
「Safety for Whom?」安全化の学習で有害応答率を26.26%から0.14%に下げた同じチェックポイントが、無害な質問の74%を拒否していた。Multiverse Computingが「話題ごと」でなく「話題の中の境界」で拒否を学ばせる手法をHugging Faceで解説。境界ペアで過剰拒否32.94%→4.16%
検証
OpenAI、13〜17歳とAIの発達に関する独立研究に500万ドルの助成 1件最大100万ドル、間接費は10%まで、応募は2026年10月6日まで(英語・Googleドキュメント1本)、採択通知は11月13日まで。資金と運営はOpenAI Group PBC。「AI製品事業者に好ましい結果かどうかにかかわらず信頼できる知見を生む能力」を審査基準に明記
OpenAI、13〜17歳とAIの発達に関する独立研究に500万ドルの助成1件最大100万ドル、間接費は10%まで、応募は2026年10月6日まで(英語・Googleドキュメント1本)、採択通知は11月13日まで。資金と運営はOpenAI Group PBC。「AI製品事業者に好ましい結果かどうかにかかわらず信頼できる知見を生む能力」を審査基準に明記
検証
Odysseyの世界モデル「Agora-2」にOpus 5.5を4回入れてみた 0キルから50キル、ボス撃破まで。ゲームエンジンのどこをAIが引き受け、どこがルールのまま残っているか
Odysseyの世界モデル「Agora-2」にOpus 5.5を4回入れてみた0キルから50キル、ボス撃破まで。ゲームエンジンのどこをAIが引き受け、どこがルールのまま残っているか
モデル
Appleの研究「Shared Selective Persistent Memory」 エージェントに会話の全履歴を持たせると成績が下がる(71%)、何も持たせないと79%、「4種類だけ選んで残す」と96%。ゼロトークンでデータ更新(14倍速)、要約駆動で1回あたりのトークン97分の1、記憶はワークスペース単位で他の人に渡せる
Appleの研究「Shared Selective Persistent Memory」エージェントに会話の全履歴を持たせると成績が下がる(71%)、何も持たせないと79%、「4種類だけ選んで残す」と96%。ゼロトークンでデータ更新(14倍速)、要約駆動で1回あたりのトークン97分の1、記憶はワークスペース単位で他の人に渡せる
研究
Appleの研究「価値観を教え込むとLLMはどう変わるか」 好奇心・共感・誠実さなどの価値を選んで微調整すると、関連する別の価値(時に相反する価値)まで表れ、肯定的な価値は安全性を上げるが、どの価値でも擬人化した言葉遣いが増えて「肯定し、追従する」モデルになる
Appleの研究「価値観を教え込むとLLMはどう変わるか」好奇心・共感・誠実さなどの価値を選んで微調整すると、関連する別の価値(時に相反する価値)まで表れ、肯定的な価値は安全性を上げるが、どの価値でも擬人化した言葉遣いが増えて「肯定し、追従する」モデルになる
研究
Google×HHMI Janeliaがオスのショウジョウバエの脳と中枢神経系の完全な配線図を公開 16万6,000超のニューロン・1億2,500万のシナプス結合で「ニューロン数で史上最大の脳地図」。AIが電子顕微鏡画像を3D再構成し、人が校正。メスの地図と比べて求愛・攻撃の回路を調べられる。次は魚の脳全体
Google×HHMI Janeliaがオスのショウジョウバエの脳と中枢神経系の完全な配線図を公開16万6,000超のニューロン・1億2,500万のシナプス結合で「ニューロン数で史上最大の脳地図」。AIが電子顕微鏡画像を3D再構成し、人が校正。メスの地図と比べて求愛・攻撃の回路を調べられる。次は魚の脳全体
研究
Sakana AI、LSTM考案者の一人シュミットフーバー氏を招聘 Transformer論文の共著者は氏ではなく同社CTOのLlion Jones氏
Sakana AI、LSTM考案者の一人シュミットフーバー氏を招聘Transformer論文の共著者は氏ではなく同社CTOのLlion Jones氏
業界
Claude Opus 5.5は本当に最強か 第三者ベンチマーク2社で総合1位、研究課題で初の人間基準超え。ただしフォールバック込みの数字と、筆者が見た「暴れ馬」の癖
Claude Opus 5.5は本当に最強か第三者ベンチマーク2社で総合1位、研究課題で初の人間基準超え。ただしフォールバック込みの数字と、筆者が見た「暴れ馬」の癖
モデル
Google、宇宙データセンター研究「Project Suncatcher」の試作衛星を来週打ち上げへ 太陽光は地上の最大8倍、論文は打ち上げ費用200ドル/kgで電力コストが地上並みと試算
Google、宇宙データセンター研究「Project Suncatcher」の試作衛星を来週打ち上げへ太陽光は地上の最大8倍、論文は打ち上げ費用200ドル/kgで電力コストが地上並みと試算
業界
OpenAI、メンタルヘルス対応を測る「MentalHealthBench」を公開 緊急時以外の会話まで、80人超の専門家が採点基準を作成
OpenAI、メンタルヘルス対応を測る「MentalHealthBench」を公開緊急時以外の会話まで、80人超の専門家が採点基準を作成
研究
Sakana AI、社内で育ってきた研究グループ「Frontier Intelligence Group」を公表 Transformer論文共著者のCTO Llion Jones氏が問うポストTransformer
Sakana AI、社内で育ってきた研究グループ「Frontier Intelligence Group」を公表Transformer論文共著者のCTO Llion Jones氏が問うポストTransformer
研究
Claudeが新しい酵素システム「ART」を自力で発見 指示は「相棒の遺伝子を探せ」だけ、生のDNAを読んでCRISPRに似た繰り返しに気づいた
Claudeが新しい酵素システム「ART」を自力で発見指示は「相棒の遺伝子を探せ」だけ、生のDNAを読んでCRISPRに似た繰り返しに気づいた
研究
Anthropicの「Model Hardware Standard(MHS)」 AIエージェントが顕微鏡・分注ロボット・ロボットアームを安全に動かすための共通規格を研究プレビュー。標準ドライバの「read/write」、自然言語のタグから機器の参照ファイルを自動生成、MCP・CLI・コードの3経路。HHMI Janeliaと開発、Genentechが実装、量子コンピュータのレーザー校正まで
Anthropicの「Model Hardware Standard(MHS)」AIエージェントが顕微鏡・分注ロボット・ロボットアームを安全に動かすための共通規格を研究プレビュー。標準ドライバの「read/write」、自然言語のタグから機器の参照ファイルを自動生成、MCP・CLI・コードの3経路。HHMI Janeliaと開発、Genentechが実装、量子コンピュータのレーザー校正まで
研究