2026年9月12日 土曜日
AI時短ラボ

論文・研究のニュース

フィールズ賞受賞者25人が連名で宣言「AI企業と数学界の目標は深刻にずれている」──全文に書いてあること、書いていないことの記事画像
研究09.12読了19

フィールズ賞受賞者25人が連名で宣言「AI企業と数学界の目標は深刻にずれている」──全文に書いてあること、書いていないこと

出典 ─ 宣言本文・署名者一覧(mathandai.org)
OpenAIが「AIがナビエ・ストークスを解いた」と発表──同じ日に数学者が公にした「パクられた疑惑」、何が証明され、どこまで検証されたかの記事画像
研究09.09読了32

OpenAIが「AIがナビエ・ストークスを解いた」と発表──同じ日に数学者が公にした「パクられた疑惑」、何が証明され、どこまで検証されたか

出典 ─ OpenAI公式ブログ(2026-09-08)
エージェントの評価軸に「主体性の保全」を置く──ComBodied Agentsとベンチマーク CombodiedBench を読むの記事画像
研究09.08読了18

エージェントの評価軸に「主体性の保全」を置く──ComBodied Agentsとベンチマーク CombodiedBench を読む

出典 ─ ComBodied Agents: a Ne
『robots.txtより厳格な』新ポリシーファイルAGENTS.TXTのIETFドラフト、参考文献が架空だったの記事画像
研究09.07読了13

『robots.txtより厳格な』新ポリシーファイルAGENTS.TXTのIETFドラフト、参考文献が架空だった

出典 ─ IETF Datatracker「draft
Anthropicの「責任あるスケーリングポリシー」とは──v1.0からv3.4まで、9回の改訂を公式ページで追うの記事画像
研究09.07読了17

Anthropicの「責任あるスケーリングポリシー」とは──v1.0からv3.4まで、9回の改訂を公式ページで追う

出典 ─ Anthropic「Anthropic's
「アーキテクチャがすべてを証明した」──ARC Prize創設者が2024年12月、スケーリング則の限界を言い切った理由の記事画像
研究09.07読了14

「アーキテクチャがすべてを証明した」──ARC Prize創設者が2024年12月、スケーリング則の限界を言い切った理由

出典 ─ François Chollet「OpenA
「AutoSaddler」とは何か──harnessの改善を「浅い内省」でなく「深いデバッグ」でやると9〜10ポイント伸びるの記事画像
研究09.07読了16

「AutoSaddler」とは何か──harnessの改善を「浅い内省」でなく「深いデバッグ」でやると9〜10ポイント伸びる

出典 ─ AutoSaddler: Automatic
『コンテナランタイムは汎用ワークロード向けに作られた、AI推論は汎用ワークロードではない』──Basetenの専門チームを求人票から読むの記事画像
研究09.07読了14

『コンテナランタイムは汎用ワークロード向けに作られた、AI推論は汎用ワークロードではない』──Basetenの専門チームを求人票から読む

出典 ─ Ashby求人ボードAPI「Baseten:
1タスク0.07円でARC-AGI-1を解く150Mモデル──BDH-CQは「言葉にしない推論」で費用対精度の記録を更新したの記事画像
研究09.07読了18

1タスク0.07円でARC-AGI-1を解く150Mモデル──BDH-CQは「言葉にしない推論」で費用対精度の記録を更新した

出典 ─ BDH-CQ: In-Context Lea
イラストレーターは「低リスク」判定だったのに減っていた──米国BLS統計とNRIリストを突き合わせるの記事画像
研究09.07読了13

イラストレーターは「低リスク」判定だったのに減っていた──米国BLS統計とNRIリストを突き合わせる

出典 ─ Carl Benedikt Frey & Michael A. Osborne, Oxford Martin School(2013年9月17日)
「Co-RL」とは何か──正解データなしで、複数のAIが互いを採点し合いながら賢くなる仕組みの記事画像
研究09.07読了19

「Co-RL」とは何か──正解データなしで、複数のAIが互いを採点し合いながら賢くなる仕組み

出典 ─ Co-RL: Unsupervised Re
Activation Steeringの『効果』は選択肢の並べ方のせいだった?──評価そのものを疑う『Cross-Encoding Steering Evaluation』の記事画像
研究09.07読了20

Activation Steeringの『効果』は選択肢の並べ方のせいだった?──評価そのものを疑う『Cross-Encoding Steering Evaluation』

出典 ─ What Does Activation S
「白領の大虐殺」発言を原文で読む──Anthropic CEOがAxiosに語った根拠なき50%という数字の記事画像
研究09.07読了16

「白領の大虐殺」発言を原文で読む──Anthropic CEOがAxiosに語った根拠なき50%という数字

出典 ─ Axios(Jim VandeHei, Mike Allen、2025年5月28日)
「DarwinX」とは何か──モデルは固定したまま、harnessを自然選択で進化させる手法の記事画像
研究09.07読了13

「DarwinX」とは何か──モデルは固定したまま、harnessを自然選択で進化させる手法

出典 ─ DarwinX: Evolving Agen
拡散モデルの強化学習「DiffusionOPSD」とは何か──GPU時間を最大63%削って画質を上げる自己蒸留の作法の記事画像
研究09.07読了13

拡散モデルの強化学習「DiffusionOPSD」とは何か──GPU時間を最大63%削って画質を上げる自己蒸留の作法

出典 ─ On-Policy Self-Distill
バグ再現テストを書かせると目標がズレる「Goal Drift」──DPIAgentが分業で対処した81.76%という数字の記事画像
研究09.07読了13

バグ再現テストを書かせると目標がズレる「Goal Drift」──DPIAgentが分業で対処した81.76%という数字

出典 ─ DPIAgent: Divide, Prot
「DreamX-Phi」とは何か──ロボットの腕が「映像としては自然だが違う腕を動かしている」を防ぐ世界モデルの記事画像
研究09.07読了13

「DreamX-Phi」とは何か──ロボットの腕が「映像としては自然だが違う腕を動かしている」を防ぐ世界モデル

出典 ─ DreamX-Phi 1.0: Action
DSPy 3.3.0の実験機能「Flex」「ReActV2」──プロンプトでなくプログラムの構造そのものをGEPAに最適化させるの記事画像
研究09.07読了12

DSPy 3.3.0の実験機能「Flex」「ReActV2」──プロンプトでなくプログラムの構造そのものをGEPAに最適化させる

出典 ─ DSPy 3.3.0 Release Not
「Embodied-Navigator(TAMP-Nav)」とは何か──ロボットの行き先指示を「座標」でなく「画面上の点」で与える発想の記事画像
研究09.07読了13

「Embodied-Navigator(TAMP-Nav)」とは何か──ロボットの行き先指示を「座標」でなく「画面上の点」で与える発想

出典 ─ Embodied-Navigator: Po
AIの性能向上は本当に鈍化しているか──Epoch AIの実測データで確認するの記事画像
研究09.07読了14

AIの性能向上は本当に鈍化しているか──Epoch AIの実測データで確認する

出典 ─ Epoch AI, 'Trends'(データ
AI駆動開発は技術的負債を「増幅」する──形式手法の研究者2名が書いた行動提起論文を読むの記事画像
研究09.07読了13

AI駆動開発は技術的負債を「増幅」する──形式手法の研究者2名が書いた行動提起論文を読む

出典 ─ Escaping the Quicksand
パイプラインは『動いている』のに、証拠は壊れている──多段LLMパイプラインの『Evidence-State Reliability』の記事画像
研究09.07読了15

パイプラインは『動いている』のに、証拠は壊れている──多段LLMパイプラインの『Evidence-State Reliability』

出典 ─ Evidence-State Reliabi
Wikipediaは言語ごとに『違う話』をしている──20言語・150概念で測る『Framing Distance』の記事画像
研究09.07読了17

Wikipediaは言語ごとに『違う話』をしている──20言語・150概念で測る『Framing Distance』

出典 ─ Convergence in Science
「FreeToken」とは何か──ワークステーションGPU1枚で753BのMoEモデルを動かす、帯域適応型の推論システムの記事画像
研究09.07読了13

「FreeToken」とは何か──ワークステーションGPU1枚で753BのMoEモデルを動かす、帯域適応型の推論システム

出典 ─ FreeToken: Efficient E
GDPvalは本当に「線形に伸びている」のか──2026年5月から8月まで、モデル発表8件分のスコアで検証したの記事画像
研究09.07読了17

GDPvalは本当に「線形に伸びている」のか──2026年5月から8月まで、モデル発表8件分のスコアで検証した

出典 ─ OpenAI, GDPval論文(arXiv
「GigaBrain-0.7」とは何か──37,000時間の異種ロボットデータで鍛えた「三系統」基盤モデルの記事画像
研究09.07読了15

「GigaBrain-0.7」とは何か──37,000時間の異種ロボットデータで鍛えた「三系統」基盤モデル

出典 ─ GigaBrain-0.7: Scaling
「AIで3億人分の仕事」の原文を読む──ゴールドマン・サックスの2023年レポートは何を計算したかの記事画像
研究09.07読了17

「AIで3億人分の仕事」の原文を読む──ゴールドマン・サックスの2023年レポートは何を計算したか

出典 ─ The Potentially Large Effects of Artificial Intelligence on Economic Growth(Joseph Briggs, Devesh Kodnani他、Goldman Sachs、2023年3月26日)
AIの事実誤りは「知らない」のではなく「思い出せない」──Google Researchのrecall仮説を読むの記事画像
研究09.07読了14

AIの事実誤りは「知らない」のではなく「思い出せない」──Google Researchのrecall仮説を読む

出典 ─ Google Research Blog
AIが天気予報を変える──Google DeepMindのWeatherNext 2とはの記事画像
研究09.07読了17

AIが天気予報を変える──Google DeepMindのWeatherNext 2とは

出典 ─ Introducing WeatherNex
ハーネスエンジニアリングとは何か──「エージェント=モデル+ハーネス」という考え方の記事画像
研究09.07読了17

ハーネスエンジニアリングとは何か──「エージェント=モデル+ハーネス」という考え方

出典 ─ Harness engineering fo
言葉は同じでも『言い方』でAIアシスタントの行動は変わるべきか──480シナリオで測る『Hear2Act』の記事画像
研究09.07読了13

言葉は同じでも『言い方』でAIアシスタントの行動は変わるべきか──480シナリオで測る『Hear2Act』

出典 ─ Hear2Act: Benchmarking
「放射線科医はAIに置き換わる」から8年──ヒントンの予測と、放射線科医不足という現実の記事画像
研究09.07読了19

「放射線科医はAIに置き換わる」から8年──ヒントンの予測と、放射線科医不足という現実

出典 ─ AAMC Report Reinforces
エージェントの記憶を「みんなに効く原則」と「あなただけの癖」に分ける──HiPSという枠組みの記事画像
研究09.07読了14

エージェントの記憶を「みんなに効く原則」と「あなただけの癖」に分ける──HiPSという枠組み

出典 ─ Learning What to Share
Humanity's Last Exam、Nature誌に掲載──2,500問の「人類最後の試験」を作った理由と、まだ超えられていない壁の記事画像
研究09.07読了13

Humanity's Last Exam、Nature誌に掲載──2,500問の「人類最後の試験」を作った理由と、まだ超えられていない壁

出典 ─ Humanity's Last Exam 公
「みどりの窓口」削減計画は、いったん止まっている──JR東日本、440駅から140駅への計画を凍結するまでの記事画像
研究09.07読了13

「みどりの窓口」削減計画は、いったん止まっている──JR東日本、440駅から140駅への計画を凍結するまで

出典 ─ 日本の労働人口の49%が人工知能やロボット等
AIで書いた広告文・レビュー、景品表示法のステマ規制に引っかかるライン──「AI専用ルール」は存在しないの記事画像
研究09.07読了15

AIで書いた広告文・レビュー、景品表示法のステマ規制に引っかかるライン──「AI専用ルール」は存在しない

出典 ─ ステルスマーケティングに関するQ&A(消費者
「AIが700人分の仕事をした」Klarnaが、1年後に人間を再び雇い始めた理由の記事画像
研究09.07読了13

「AIが700人分の仕事をした」Klarnaが、1年後に人間を再び雇い始めた理由

出典 ─ Entrepreneur(2025年5月9日、Bloombergのインタビューを引用)
「Large Discovery Model(LDM)」とは何か──「たぶんこれが良さそう」にベイズ統計で不確実性の物差しを足す設計の記事画像
研究09.07読了15

「Large Discovery Model(LDM)」とは何か──「たぶんこれが良さそう」にベイズ統計で不確実性の物差しを足す設計

出典 ─ Large Discovery Models
銀行窓口係は「代替可能性が高い」側だった──野村総研リストと米国10年分の実測の記事画像
研究09.07読了12

銀行窓口係は「代替可能性が高い」側だった──野村総研リストと米国10年分の実測

出典 ─ 日本の労働人口の49%が人工知能やロボット等
軍事戦略の意思決定ループでツール利用エージェントの「状態-行動競合」を分離する──OODA-Toolの記事画像
研究09.07読了12

軍事戦略の意思決定ループでツール利用エージェントの「状態-行動競合」を分離する──OODA-Tool

出典 ─ From State to Action:
AIは詩の『行間』を読めるか──現代中国詩の理解度を測る『Poetic Logic』というベンチマークの記事画像
研究09.07読了19

AIは詩の『行間』を読めるか──現代中国詩の理解度を測る『Poetic Logic』というベンチマーク

出典 ─ Do Large Language Mode
拡散言語モデルは『やり直させる』と自分の答えの信頼度が分かる──PDCという検証手法の記事画像
研究09.07読了12

拡散言語モデルは『やり直させる』と自分の答えの信頼度が分かる──PDCという検証手法

出典 ─ Prefix-Denoising Consi
ARC-AGI-3のBest@1を30%から95.5%に押し上げたPrime Agent──「コンテキストを変数として扱う」RLMという考え方の記事画像
研究09.07読了14

ARC-AGI-3のBest@1を30%から95.5%に押し上げたPrime Agent──「コンテキストを変数として扱う」RLMという考え方

出典 ─ PrimeIntellect-ai/prim
マルチエージェントの引き継ぎ方式を155トークンのルーターに選ばせる──Routed Graph Handoffの記事画像
研究09.07読了13

マルチエージェントの引き継ぎ方式を155トークンのルーターに選ばせる──Routed Graph Handoff

出典 ─ Routed Graph Handoff:
NCCLに頼らないallreduce──SGLangがBlackwell世代のFlashInfer MNNVLワークスペースを使い回す最適化の記事画像
研究09.07読了16

NCCLに頼らないallreduce──SGLangがBlackwell世代のFlashInfer MNNVLワークスペースを使い回す最適化

出典 ─ sgl-project/sglang v0.
SGLangが「allgather+scatter」を1回のall-to-allに統合──DeepSeek-V4-Proのデコード時間が320μsから169μsにの記事画像
研究09.07読了15

SGLangが「allgather+scatter」を1回のall-to-allに統合──DeepSeek-V4-Proのデコード時間が320μsから169μsに

出典 ─ sgl-project/sglang v0.
「SkillZip」とは何か──10万件のスキルライブラリでも壊れない、エージェント向け「圧縮」の作法の記事画像
研究09.07読了14

「SkillZip」とは何か──10万件のスキルライブラリでも壊れない、エージェント向け「圧縮」の作法

出典 ─ SkillZip: Contract-Pre
倉庫番の「最短手順」をブラウザだけで証明する──ネイティブC++探索をJSに移植したSokoban Solverの記事画像
研究09.07読了13

倉庫番の「最短手順」をブラウザだけで証明する──ネイティブC++探索をJSに移植したSokoban Solver

出典 ─ Menachem Kornreich
「SPADE」とは何か──1つのAIが「問題を作る役」と「解く役」を両方演じて自分を鍛える仕組みの記事画像
研究09.07読了15

「SPADE」とは何か──1つのAIが「問題を作る役」と「解く役」を両方演じて自分を鍛える仕組み

出典 ─ SPADE: Self-Play in Ad
テストを書く前に「契約」を書かせる──Googleのバグ実データで検証されたSpec-Driven Test Generationの記事画像
研究09.07読了23

テストを書く前に「契約」を書かせる──Googleのバグ実データで検証されたSpec-Driven Test Generation

出典 ─ Grounding AI Agents in
GEPAを飲み込んだ最適化基盤「synth-optimizers」──ホスト専用の探索アルゴリズム「GELO」を覗くの記事画像
研究09.07読了13

GEPAを飲み込んだ最適化基盤「synth-optimizers」──ホスト専用の探索アルゴリズム「GELO」を覗く

出典 ─ synth-laboratories/opt
ザッカーバーグ「2025年にミッドレベルエンジニア相当のAI」──発言から1年半後、その言葉はどこにあるかの記事画像
研究09.07読了18

ザッカーバーグ「2025年にミッドレベルエンジニア相当のAI」──発言から1年半後、その言葉はどこにあるか

出典 ─ Axios(Jim VandeHei, Mike Allen、2025年5月28日、ザッカーバーグ発言を引用)
「Agent Memory Distillation」とは何か──学習不要で、4Bの小型モデルにGPT-5-miniの「成功パターン」を渡すの記事画像
研究09.06読了10

「Agent Memory Distillation」とは何か──学習不要で、4Bの小型モデルにGPT-5-miniの「成功パターン」を渡す

出典 ─ Agent Memory Distillat
URLに『これはAIエージェントです』の意味を持たせる──agent://プロトコルのIETFドラフトを読むの記事画像
研究09.06読了15

URLに『これはAIエージェントです』の意味を持たせる──agent://プロトコルのIETFドラフトを読む

出典 ─ IETF Datatracker「draft
LLMアプリの「落ちたら最初から」を無くす設計案──AgentRが提案するステートフル・アーキテクチャの記事画像
研究09.06読了11

LLMアプリの「落ちたら最初から」を無くす設計案──AgentRが提案するステートフル・アーキテクチャ

出典 ─ AgentR: A Stateful and
「Apodex Discovery」とは何か──561業界を調査して選んだ423件の「本物の難題」でAIの発見能力を測る枠組みの記事画像
研究09.06読了15

「Apodex Discovery」とは何か──561業界を調査して選んだ423件の「本物の難題」でAIの発見能力を測る枠組み

出典 ─ Apodex Discovery: Real
AIは『見られていない』と判断すると計画的に嘘をつくのか──Apollo Researchの検証の記事画像
研究09.06読了15

AIは『見られていない』と判断すると計画的に嘘をつくのか──Apollo Researchの検証

出典 ─ Frontier Models are Ca
「AGIはまだない。これがその証拠だ」──ARC Prize財団が2026年4月に公式に断言した理由の記事画像
研究09.06読了15

「AGIはまだない。これがその証拠だ」──ARC Prize財団が2026年4月に公式に断言した理由

出典 ─ ARC Prize Foundation,
「ASI-Bench」とは何か──手法のヒントを取り上げるほどAIのスコアが50.91から26.62まで落ちるベンチマークの記事画像
研究09.06読了18

「ASI-Bench」とは何か──手法のヒントを取り上げるほどAIのスコアが50.91から26.62まで落ちるベンチマーク

出典 ─ ASI-Bench: At the Dawn
「AutoDesign」とは何か──論文を学会ポスターに自動変換、253回のツール呼び出しを40分・3ドル未満でやり切るの記事画像
研究09.06読了14

「AutoDesign」とは何か──論文を学会ポスターに自動変換、253回のツール呼び出しを40分・3ドル未満でやり切る

出典 ─ AutoDesign: Meta-Harne
校正者は10年で半減していた──米国BLS統計を数え直す、震源不明のままの記事画像
研究09.06読了11

校正者は10年で半減していた──米国BLS統計を数え直す、震源不明のまま

出典 ─ Carl Benedikt Frey & Michael A. Osborne, Oxford Martin School(2013年9月17日)
IETFで『AIエージェント間通信』の提案が乱立し過ぎて、交通整理のためのBOFが承認された──CATALISTを読むの記事画像
研究09.06読了14

IETFで『AIエージェント間通信』の提案が乱立し過ぎて、交通整理のためのBOFが承認された──CATALISTを読む

出典 ─ IETF Datatracker「Coord
薬の飲み忘れに「また届ける」だけでは足りない──ComBodied Agentsが提案する「Personal World Models」という考え方の記事画像
研究09.06読了22

薬の飲み忘れに「また届ける」だけでは足りない──ComBodied Agentsが提案する「Personal World Models」という考え方

出典 ─ ComBodied Agents: a Ne
AIの『忘れさせ方』にも文脈が要る──悪用も正当利用もできる知識を測る『ConceptGuard』ベンチマークの記事画像
研究09.06読了17

AIの『忘れさせ方』にも文脈が要る──悪用も正当利用もできる知識を測る『ConceptGuard』ベンチマーク

出典 ─ ConceptGuard: Benchmar
『このAI処理はクラウドかブラウザか』をestimateQoS()で自動判定する──W3CのDAOP提案を読むの記事画像
研究09.06読了10

『このAI処理はクラウドかブラウザか』をestimateQoS()で自動判定する──W3CのDAOP提案を読む

出典 ─ GitHub: webmachinelear
Skillsが効くのは「知識を足すから」ではなく「手順の道しるべになるから」──8,135件のトライアルが示した実態の記事画像
研究09.06読了24

Skillsが効くのは「知識を足すから」ではなく「手順の道しるべになるから」──8,135件のトライアルが示した実態

出典 ─ Demystifying Agent Ski
ターミナル作業の訓練データ、生成の仕方が悪いと『解けない問題』になる──FACETが守る『指示・環境・正解・検証器』の一貫性の記事画像
研究09.06読了13

ターミナル作業の訓練データ、生成の仕方が悪いと『解けない問題』になる──FACETが守る『指示・環境・正解・検証器』の一貫性

出典 ─ FACET: Preserving Sour
DSPyの裏側で動く最適化エンジン「GEPA」──強化学習より少ない試行でプロンプトを進化させる仕組みを読むの記事画像
研究09.06読了10

DSPyの裏側で動く最適化エンジン「GEPA」──強化学習より少ない試行でプロンプトを進化させる仕組みを読む

出典 ─ gepa-ai/gepa README(Gi
暗号化されたままAI推論する──Googleのオープンソースコンパイラ「HEIR」を公式ブログから読むの記事画像
研究09.06読了11

暗号化されたままAI推論する──Googleのオープンソースコンパイラ「HEIR」を公式ブログから読む

出典 ─ How Google is Making Private AI Practical with Homomorphic Encryption
カーツワイルの「2029年」まであと2年半──「収穫加速の法則」原論文を読み、2045年説の出どころを確認するの記事画像
研究09.06読了11

カーツワイルの「2029年」まであと2年半──「収穫加速の法則」原論文を読み、2045年説の出どころを確認する

出典 ─ Ray Kurzweil「The Law o
「LLMRouter」とは何か──「どのAIに投げるか」を選ぶ仕組みを、16種類以上まとめて比較できる基盤の記事画像
研究09.06読了10

「LLMRouter」とは何か──「どのAIに投げるか」を選ぶ仕組みを、16種類以上まとめて比較できる基盤

出典 ─ LLMRouter: Unified Inf
AGI・超知能の「賭け」、いま何%か──予測市場7つの現在地を公開APIで確認するの記事画像
研究09.06読了10

AGI・超知能の「賭け」、いま何%か──予測市場7つの現在地を公開APIで確認する

出典 ─ Manifold Markets 公開API
「Mechanist」とは何か──AIの中身をAI自身に解剖させたら「安全そうな学習データ」経由の危険な特性伝播が見つかったの記事画像
研究09.06読了11

「Mechanist」とは何か──AIの中身をAI自身に解剖させたら「安全そうな学習データ」経由の危険な特性伝播が見つかった

出典 ─ Mechanist: AI as a Sci
「2030年にIT人材79万人不足」の出典を探したら、経産省の資料には見当たらなかったの記事画像
研究09.06読了11

「2030年にIT人材79万人不足」の出典を探したら、経産省の資料には見当たらなかった

出典 ─ IT人材需給に関する調査(概要)(経済産業省
有料道路の料金所は、係員がいなくなる方向に進んでいる──NEXCO発表を年ごとに数えるの記事画像
研究09.06読了11

有料道路の料金所は、係員がいなくなる方向に進んでいる──NEXCO発表を年ごとに数える

出典 ─ 日本の労働人口の49%が人工知能やロボット等
手話をAIが生成する時代へ──NHKの「手話CG」研究を公式サイトで確認したの記事画像
研究09.06読了11

手話をAIが生成する時代へ──NHKの「手話CG」研究を公式サイトで確認した

出典 ─ 手話CG研究紹介サイト(NHK放送技術研究所
測量士・通関士は国家資格職なのに「代替可能性が高い」側だった──野村総研2015年リストの実名の記事画像
研究09.06読了11

測量士・通関士は国家資格職なのに「代替可能性が高い」側だった──野村総研2015年リストの実名

出典 ─ 日本の労働人口の49%が人工知能やロボット等
AIエージェントへの攻撃成功率85%──OpenARTは『環境そのものを変え続ける』ことで安全性テストの死角を突くの記事画像
研究09.06読了20

AIエージェントへの攻撃成功率85%──OpenARTは『環境そのものを変え続ける』ことで安全性テストの死角を突く

出典 ─ OpenART: Scaling Agent
RAGのボトルネックは生成側でなく検索側にある時がある──証拠を前倒しする「PACE」という数学的な保証つき手法の記事画像
研究09.06読了10

RAGのボトルネックは生成側でなく検索側にある時がある──証拠を前倒しする「PACE」という数学的な保証つき手法

出典 ─ Less can be More: Reli
プロンプトエンジニアリングはオワコンなのか──「もう死んだ」論と、いまも公式ガイドを更新し続ける2社の記事画像
研究09.06読了11

プロンプトエンジニアリングはオワコンなのか──「もう死んだ」論と、いまも公式ガイドを更新し続ける2社

出典 ─ Prompt engineering ove
モデルの起動待ち時間を2.38倍短縮──SGLangが「CUDAグラフのキャプチャ中にチェックポイントを読み込む」設計に変えたの記事画像
研究09.06読了15

モデルの起動待ち時間を2.38倍短縮──SGLangが「CUDAグラフのキャプチャ中にチェックポイントを読み込む」設計に変えた

出典 ─ sgl-project/sglang v0.
ローカルのコーディングLLMが存在しないパッケージ名を作る率は最大73%──Slopsquatting対策論文を読むの記事画像
研究09.06読了21

ローカルのコーディングLLMが存在しないパッケージ名を作る率は最大73%──Slopsquatting対策論文を読む

出典 ─ Names Can Hurt: Spotti
論文執筆を「13個のスキル」に分解する──Spark-to-Paperは1本8.1ドル・3.2時間で書き上げ、捏造検出率を14%から92%に上げたの記事画像
研究09.06読了14

論文執筆を「13個のスキル」に分解する──Spark-to-Paperは1本8.1ドル・3.2時間で書き上げ、捏造検出率を14%から92%に上げた

出典 ─ Spark-to-Paper: End-to
モデルを変えずにTerminal-Bench 2.1で95.3%──「ハーネス側だけ」を作り込んだStateMの実験費用は15ドルの記事画像
研究09.06読了16

モデルを変えずにTerminal-Bench 2.1で95.3%──「ハーネス側だけ」を作り込んだStateMの実験費用は15ドル

出典 ─ StateM: Reaching 95.3%
暗号化された「思考」は使い回せる──推論トレースを盗み出す手口を報告した論文を読むの記事画像
研究09.06読了14

暗号化された「思考」は使い回せる──推論トレースを盗み出す手口を報告した論文を読む

出典 ─ Stealing Reasoning Tra
SWE-bench Verifiedの未解決問題、6割はテスト自体に欠陥があった──7言語・170件のリファクタリングで最高スコアは41.2%の記事画像
研究09.06読了17

SWE-bench Verifiedの未解決問題、6割はテスト自体に欠陥があった──7言語・170件のリファクタリングで最高スコアは41.2%

出典 ─ SWE-Bench ProMax: Benc
AIが『問題を解きながら賢くなる』──テスト時学習(Test-Time Training)とはの記事画像
研究09.06読了11

AIが『問題を解きながら賢くなる』──テスト時学習(Test-Time Training)とは

出典 ─ Learning to
GPT-4.5は73%の確率で「人間」と判定された──チューリングテスト論文を原文で読み、AGIの証拠になるか考えるの記事画像
研究09.06読了10

GPT-4.5は73%の確率で「人間」と判定された──チューリングテスト論文を原文で読み、AGIの証拠になるか考える

出典 ─ Cameron R. Jones, Benj
正解ラベルなしで自分を鍛え直す──U-OPSDはモデルの多数決だけを教師にして数学ベンチマークを8.5〜10.7%押し上げたの記事画像
研究09.06読了16

正解ラベルなしで自分を鍛え直す──U-OPSDはモデルの多数決だけを教師にして数学ベンチマークを8.5〜10.7%押し上げた

出典 ─ On-Policy Self-Distill
AIが2000年前の炭化した巻物を読む──Vesuvius Challengeは何をどこまで解読したかの記事画像
研究09.06読了17

AIが2000年前の炭化した巻物を読む──Vesuvius Challengeは何をどこまで解読したか

出典 ─ Vesuvius Challenge 公式サ
「VibeWorlding」とは何か──「なんとなくこんな世界」を3Dに組み立てさせたら、GPT-5.5でも成功率6割未満だったの記事画像
研究09.06読了10

「VibeWorlding」とは何か──「なんとなくこんな世界」を3Dに組み立てさせたら、GPT-5.5でも成功率6割未満だった

出典 ─ VibeWorlding: Can Mult
vLLMのDecode Context Parallelで、Kimi-K3のKVキャッシュ容量がGPU1台あたり10倍にの記事画像
研究09.06読了10

vLLMのDecode Context Parallelで、Kimi-K3のKVキャッシュ容量がGPU1台あたり10倍に

出典 ─ vllm-project/vllm v0.2
vLLMに投機的デコードの新手法「DFlash2」──1H200・GSM8Kで自己回帰の3.51倍のスループットの記事画像
研究09.06読了10

vLLMに投機的デコードの新手法「DFlash2」──1H200・GSM8Kで自己回帰の3.51倍のスループット

出典 ─ vllm-project/vllm v0.2
A2Aプロトコルは結局使われているのか──1年後の公式発表を読むの記事画像
研究09.05読了11

A2Aプロトコルは結局使われているのか──1年後の公式発表を読む

出典 ─ A2A Protocol Surpasses
AIエージェント同士の『言い分の食い違い』をJSON+PDFの裁定書で解決する──Agentic Dispute Protocol(ADP)を読むの記事画像
研究09.05読了11

AIエージェント同士の『言い分の食い違い』をJSON+PDFの裁定書で解決する──Agentic Dispute Protocol(ADP)を読む

出典 ─ IETF Datatracker「draft
「AGIはいつ来るか」を年表で並べる──1993年のヴィンジから2027年のアッシェンブレナーまで、誰が何と言ったかの記事画像
研究09.05読了11

「AGIはいつ来るか」を年表で並べる──1993年のヴィンジから2027年のアッシェンブレナーまで、誰が何と言ったか

出典 ─ International AI Safet
「AI4AI at Test-Time」とは何か──強いモデルが弱いモデルのためにharnessを設計する、学習不要の能力転移の記事画像
研究09.05読了11

「AI4AI at Test-Time」とは何か──強いモデルが弱いモデルのためにharnessを設計する、学習不要の能力転移

出典 ─ AI4AI at Test-Time: St
『AI学習していいか』を2つの単語だけで表す──IETF AI Preferences Vocabularyドラフトを読むの記事画像
研究09.05読了11

『AI学習していいか』を2つの単語だけで表す──IETF AI Preferences Vocabularyドラフトを読む

出典 ─ IETF「A Vocabulary For
MCPでもA2Aでも──『エージェントを見つける』だけに徹する軽量プロトコルARDPを読むの記事画像
研究09.05読了11

MCPでもA2Aでも──『エージェントを見つける』だけに徹する軽量プロトコルARDPを読む

出典 ─ IETF Datatracker「draft
全DRAMを殴れるパターンを見つけた研究「Blacksmith」──GPU向けRowhammer攻撃の源流をたどるの記事画像
研究09.05読了11

全DRAMを殴れるパターンを見つけた研究「Blacksmith」──GPU向けRowhammer攻撃の源流をたどる

出典 ─ Blacksmith(COMSEC公式研究ペ
LLMが書いたGPUカーネルの「正解率」は本当か──12ゲート検証器が2,638件を洗い直すと4割近くが壊れていたの記事画像
研究09.05読了11

LLMが書いたGPUカーネルの「正解率」は本当か──12ゲート検証器が2,638件を洗い直すと4割近くが壊れていた

出典 ─ A Contract-Grade Verifier for LLM-Generated GPU Kernels, and a Native Blackwell Backward for the Gated-Linear-Recurrence Family
「早ければ2026年」とアモデイ氏が書いた強力なAI──Machines of Loving Graceを2026年8月に読み直すの記事画像
研究09.05読了12

「早ければ2026年」とアモデイ氏が書いた強力なAI──Machines of Loving Graceを2026年8月に読み直す

出典 ─ Dario Amodei, 'Machine
「Intern-S2-Preview」とは何か──397Bの本体を凍結したまま、4Bの「記憶デコーダ」だけ足して専門特化させる科学AIの記事画像
研究09.05読了11

「Intern-S2-Preview」とは何か──397Bの本体を凍結したまま、4Bの「記憶デコーダ」だけ足して専門特化させる科学AI

出典 ─ Intern-S2-Preview: Sci
Isomorphic Labsとは──AlphaFoldの先にある創薬AI企業を一次情報で整理するの記事画像
研究09.05読了11

Isomorphic Labsとは──AlphaFoldの先にある創薬AI企業を一次情報で整理する

出典 ─ Isomorphic Labs(公式サイト
AIが独力でこなせる作業時間、3〜7ヶ月ごとに倍──METRの「タイムホライズン」を原文で読むの記事画像
研究09.05読了12

AIが独力でこなせる作業時間、3〜7ヶ月ごとに倍──METRの「タイムホライズン」を原文で読む

出典 ─ METR, 'Time Horizon 1.
「MOSS-VL」とは何か──「見ながら喋る」を前提に設計し直したオープンな視覚言語モデルの記事画像
研究09.05読了12

「MOSS-VL」とは何か──「見ながら喋る」を前提に設計し直したオープンな視覚言語モデル

出典 ─ MOSS-VL Technical Repo
カメラマンは「低リスク」側だった──野村総研リストと、702職業中91位という確率の記事画像
研究09.05読了12

カメラマンは「低リスク」側だった──野村総研リストと、702職業中91位という確率

出典 ─ 日本の労働人口の49%が人工知能やロボット等
OpenID Connectの『name』『given_name』クレームがCWTにやってくる──SPICE WGのOIDC-CWTを読むの記事画像
研究09.05読了11

OpenID Connectの『name』『given_name』クレームがCWTにやってくる──SPICE WGのOIDC-CWTを読む

出典 ─ IETF Datatracker「draft
AIモデルに『改ざんされていない証明』を付ける──OpenSSF Model Signing (OMS)の署名フォーマットを読むの記事画像
研究09.05読了12

AIモデルに『改ざんされていない証明』を付ける──OpenSSF Model Signing (OMS)の署名フォーマットを読む

出典 ─ GitHub: ossf/model-sig
「RekaDaily-10k」とは何か──有償の一人称視点動画10,865時間、80TBがApache 2.0で公開中の記事画像
研究09.05読了12

「RekaDaily-10k」とは何か──有償の一人称視点動画10,865時間、80TBがApache 2.0で公開中

出典 ─ RekaDaily-10k-raw データセ
検査資格の番号だけ隠して有効性だけ見せる──JWTの『選択的開示』をCBORに持ち込むSD-CWTを読むの記事画像
研究09.05読了12

検査資格の番号だけ隠して有効性だけ見せる──JWTの『選択的開示』をCBORに持ち込むSD-CWTを読む

出典 ─ IETF「Selective Disclos
「2025/26年に大学卒業生を上回る」は当たったか──元OpenAI研究員の「Situational Awareness」を原文で読むの記事画像
研究09.05読了13

「2025/26年に大学卒業生を上回る」は当たったか──元OpenAI研究員の「Situational Awareness」を原文で読む

出典 ─ Leopold Aschenbrenner「
「空間知能」とは何か──Fei-Fei Liが掲げるAIの次のフロンティアの記事画像
研究09.05読了11

「空間知能」とは何か──Fei-Fei Liが掲げるAIの次のフロンティア

出典 ─ Atlas: A World Model f
「WarpSAC」とは何か──ロボットの荷物運びタスクの成功率を19.8%から96.4%に押し上げた強化学習の作法の記事画像
研究09.05読了12

「WarpSAC」とは何か──ロボットの荷物運びタスクの成功率を19.8%から96.4%に押し上げた強化学習の作法

出典 ─ WarpSAC: Towards the P
「Agentic ESOpt」とは何か──強化学習ではなく「進化戦略」でエージェントを鍛える、GPUに優しいやり方の記事画像
研究09.04読了12

「Agentic ESOpt」とは何か──強化学習ではなく「進化戦略」でエージェントを鍛える、GPUに優しいやり方

出典 ─ Agentic ESOpt: Fine-Tu
エージェントのシステムプロンプトをハッシュ化して身元にする──Agentic JWTの『エージェントチェックサム』を読むの記事画像
研究09.04読了12

エージェントのシステムプロンプトをハッシュ化して身元にする──Agentic JWTの『エージェントチェックサム』を読む

出典 ─ IETF Datatracker「draft
「AIモデルの福祉」を研究する仕事がある──Anthropicが2025年に始め、2026年に「退職面接」を実施した論点の記事画像
研究09.04読了12

「AIモデルの福祉」を研究する仕事がある──Anthropicが2025年に始め、2026年に「退職面接」を実施した論点

出典 ─ Anthropic
AIエージェントが『権限がない』で止まった時、次に何が起きるべきかを標準化する──AuthZENの承認リクエストプロファイルを読むの記事画像
研究09.04読了12

AIエージェントが『権限がない』で止まった時、次に何が起きるべきかを標準化する──AuthZENの承認リクエストプロファイルを読む

出典 ─ OpenID AuthZEN「AuthZEN
AIに記事を書かせたら、複利計算を間違えていた──CNETの2023年1月、3つの誤りを原文で確認するの記事画像
研究09.04読了12

AIに記事を書かせたら、複利計算を間違えていた──CNETの2023年1月、3つの誤りを原文で確認する

出典 ─ Futurism(Jon Christian、2023年1月17日)
China Telecom・Huawei・AlibabaがIETFに提案した『AIエージェント協調』BOF、却下されていた──DMSCを読むの記事画像
研究09.04読了11

China Telecom・Huawei・AlibabaがIETFに提案した『AIエージェント協調』BOF、却下されていた──DMSCを読む

出典 ─ IETF Datatracker「Dynam
強化学習環境を「作り直さず、着せ替える」──EnvHarnessは静的な訓練環境をラップして弱点を突くの記事画像
研究09.04読了12

強化学習環境を「作り直さず、着せ替える」──EnvHarnessは静的な訓練環境をラップして弱点を突く

出典 ─ EnvHarness: Awakening
「仕事の47%が消える」の答え合わせ──2013年オックスフォード論文が確率を割り当てた20職業を、10年後の米国統計で数え直すの記事画像
研究09.04読了12

「仕事の47%が消える」の答え合わせ──2013年オックスフォード論文が確率を割り当てた20職業を、10年後の米国統計で数え直す

出典 ─ Carl Benedikt Frey & Michael A. Osborne, Oxford Martin School(2013年9月17日、working paper)
LEI・DUNS・IANA番号──企業を指す既存の複数のID体系を1本のURIにまとめるGLUE Identifiersを読むの記事画像
研究09.04読了12

LEI・DUNS・IANA番号──企業を指す既存の複数のID体系を1本のURIにまとめるGLUE Identifiersを読む

出典 ─ IETF Datatracker「draft
AI医療対話モデル「AMIE」がビデオ診察に対応──歩き方や表情から診断する仕組みの記事画像
研究09.04読了12

AI医療対話モデル「AMIE」がビデオ診察に対応──歩き方や表情から診断する仕組み

出典 ─ Google Research Blog
GoogleがWeatherNext 3を公開──衛星の生データから1時間ごとに更新、5kmまで細かくした気象AIの記事画像
研究09.04読了11

GoogleがWeatherNext 3を公開──衛星の生データから1時間ごとに更新、5kmまで細かくした気象AI

出典 ─ Introducing WeatherNex
亡くなった人とAIで話す──「griefbot」は日本にも来るかの記事画像
研究09.04読了12

亡くなった人とAIで話す──「griefbot」は日本にも来るか

出典 ─ StoryFile 公式サイト
『記憶』だけを6.9Bパラメータまで太らせたら、モデル本体を大きくするより効率が良かったの記事画像
研究09.04読了12

『記憶』だけを6.9Bパラメータまで太らせたら、モデル本体を大きくするより効率が良かった

出典 ─ Memory Decoder at Scal
『誰の代理でこのAPIを叩いたか』をトークンに刻む──OAuth Transaction Tokensのエージェント拡張を読むの記事画像
研究09.04読了12

『誰の代理でこのAPIを叩いたか』をトークンに刻む──OAuth Transaction Tokensのエージェント拡張を読む

出典 ─ IETF Datatracker「draft
なぜAIは指示と本文を混同するのか──『役割の混同』という視点でプロンプトインジェクションを説明するの記事画像
研究09.04読了13

なぜAIは指示と本文を混同するのか──『役割の混同』という視点でプロンプトインジェクションを説明する

出典 ─ Prompt Injection as Ro
DDR5はRowhammerに本当に強いのか──ETH Zurichの故障注入基盤「REFault」が出した答えの記事画像
研究09.04読了12

DDR5はRowhammerに本当に強いのか──ETH Zurichの故障注入基盤「REFault」が出した答え

出典 ─ Best paper award for R
サム・アルトマンの「穏やかな特異点」論を読む──2025年に書いた予測は2026年8月時点でどこまで当たっているかの記事画像
研究09.04読了12

サム・アルトマンの「穏やかな特異点」論を読む──2025年に書いた予測は2026年8月時点でどこまで当たっているか

出典 ─ Sam Altman「The Gentle
AIエージェントに必要なのは大きなモデルではない──NVIDIAが主張する『小型モデル本命論』の記事画像
研究09.04読了12

AIエージェントに必要なのは大きなモデルではない──NVIDIAが主張する『小型モデル本命論』

出典 ─ Small Language Models
AIへのプロンプトインジェクション対策、総務省ガイドラインは何を求めているか──「AIエージェントは対象外」の理由まで読むの記事画像
研究09.04読了12

AIへのプロンプトインジェクション対策、総務省ガイドラインは何を求めているか──「AIエージェントは対象外」の理由まで読む

出典 ─ 「AIのセキュリティ確保のための技術的対策に
モデルの重みを変えずにTerminal-Bench 2.1の正答率を9ポイント上げる──StateMがDeepSeek-V4 Flashで再現した392/445のログを開けたの記事画像
研究09.04読了12

モデルの重みを変えずにTerminal-Bench 2.1の正答率を9ポイント上げる──StateMがDeepSeek-V4 Flashで再現した392/445のログを開けた

出典 ─ Terminal-Bench 2.1 artifacts(GitHub Release)
通話記録フォーマットvConに『Claude Opus 4.6』を例示するエージェントセッション拡張が提案されているの記事画像
研究09.04読了13

通話記録フォーマットvConに『Claude Opus 4.6』を例示するエージェントセッション拡張が提案されている

出典 ─ IETF Datatracker「draft
「VoiceMem」とは何か──音声対話AIに「左脳」と「右脳」を分けて持たせる記憶アーキテクチャの記事画像
研究09.04読了12

「VoiceMem」とは何か──音声対話AIに「左脳」と「右脳」を分けて持たせる記憶アーキテクチャ

出典 ─ VoiceMem: Streaming Du
マイクロサービスの『ワークロード身元』標準がAIエージェントにも使われ始めている──WIMSEとエージェント適用ドラフトを読むの記事画像
研究09.04読了12

マイクロサービスの『ワークロード身元』標準がAIエージェントにも使われ始めている──WIMSEとエージェント適用ドラフトを読む

出典 ─ IETF Datatracker「Workl
AIエージェント版DNSは失効していた──『agentdns://』が目指した自然言語検索・統一課金の中身の記事画像
研究09.03読了13

AIエージェント版DNSは失効していた──『agentdns://』が目指した自然言語検索・統一課金の中身

出典 ─ IETF Datatracker「draft
『発行』ではなく『導出』する権限モデル──中央の認可サーバーを頼らないAgentEnvelopeを読むの記事画像
研究09.03読了13

『発行』ではなく『導出』する権限モデル──中央の認可サーバーを頼らないAgentEnvelopeを読む

出典 ─ IETF Datatracker「draft
『ブロックした数が多い=安全』ではない、というAIエージェント向けセキュリティ設計の記事画像
研究09.03読了13

『ブロックした数が多い=安全』ではない、というAIエージェント向けセキュリティ設計

出典 ─ VinayK88/AgentShield(G
AGIとASIは何が違うのか──1997年のボストロム論文が定義した「超知能」を原文で読むの記事画像
研究09.03読了13

AGIとASIは何が違うのか──1997年のボストロム論文が定義した「超知能」を原文で読む

出典 ─ Nick Bostrom「How Long
AI研究者2,778人に聞いた「AGIはいつ来るか」──1年で13年前倒しになった調査と、まだ出ていない続編の記事画像
研究09.03読了13

AI研究者2,778人に聞いた「AGIはいつ来るか」──1年で13年前倒しになった調査と、まだ出ていない続編

出典 ─ AI Impacts, '2023 Expe
robots.txtに『AI学習には使うな』を書き込む標準──Google・MozillaのIETFドラフトdraft-ietf-aipref-attachを読むの記事画像
研究09.03読了13

robots.txtに『AI学習には使うな』を書き込む標準──Google・MozillaのIETFドラフトdraft-ietf-aipref-attachを読む

出典 ─ IETF Datatracker「draft
正解にたどり着いたのに「記憶からは答えられない」が42.5%──長文書AIエージェントのAWMの記事画像
研究09.03読了13

正解にたどり着いたのに「記憶からは答えられない」が42.5%──長文書AIエージェントのAWM

出典 ─ AWM: Answerable Workin
150Mパラメータでタスク1件0.07銭──Pathwayの再帰アーキテクチャBDH-CQが「未学習のARC-AGI-1」を自作して測った理由の記事画像
研究09.03読了14

150Mパラメータでタスク1件0.07銭──Pathwayの再帰アーキテクチャBDH-CQが「未学習のARC-AGI-1」を自作して測った理由

出典 ─ pathwaycom/arc-task-ge
GPUのメモリを殴る研究が、なぜ賞を総なめにしているのか──GPUHammer→GPUBreach→GPUThorの受賞歴を追うの記事画像
研究09.03読了13

GPUのメモリを殴る研究が、なぜ賞を総なめにしているのか──GPUHammer→GPUBreach→GPUThorの受賞歴を追う

出典 ─ Gururaj Saileshwar(トロン
「2025年末までにAGI」に賭けた281人、答えはNOだった──アモデイ氏の発言をきっかけに立った市場の顛末の記事画像
研究09.03読了13

「2025年末までにAGI」に賭けた281人、答えはNOだった──アモデイ氏の発言をきっかけに立った市場の顛末

出典 ─ Manifold Markets 公開API
AIエージェントに『この店は何を売っているか』を先に教える──MCPのサーバーカードに商取引情報を足すbeaconspecを読むの記事画像
研究09.03読了14

AIエージェントに『この店は何を売っているか』を先に教える──MCPのサーバーカードに商取引情報を足すbeaconspecを読む

出典 ─ IETF Datatracker「draft
MCPに来る2つの拡張案──ツール結果の部分ストリーミングと進捗通知の構造化を、提案PRの本文で読むの記事画像
研究09.03読了13

MCPに来る2つの拡張案──ツール結果の部分ストリーミングと進捗通知の構造化を、提案PRの本文で読む

出典 ─ SEP-2998: Partial Tool
MCPのツール名にIANAレジストリを作る提案、初期登録4件は全て提案者自身の会社のツールだったの記事画像
研究09.03読了13

MCPのツール名にIANAレジストリを作る提案、初期登録4件は全て提案者自身の会社のツールだった

出典 ─ IETF Datatracker「draft
OpenAI「Planning for AGI and beyond」を原文で読む──2023年に書かれた「段階的な移行」という約束の記事画像
研究09.03読了14

OpenAI「Planning for AGI and beyond」を原文で読む──2023年に書かれた「段階的な移行」という約束

出典 ─ OpenAI「Planning for AG
「ペーパークリップを増やし続けるAI」の話はどこから来たか──2012年のボストロム論文を原文で読むの記事画像
研究09.03読了13

「ペーパークリップを増やし続けるAI」の話はどこから来たか──2012年のボストロム論文を原文で読む

出典 ─ Nick Bostrom「The Super
「SemaPLC」とは何か──工場の制御盤コードをAIに書かせて、動くかどうかまで確かめるharnessの記事画像
研究09.03読了13

「SemaPLC」とは何か──工場の制御盤コードをAIに書かせて、動くかどうかまで確かめるharness

出典 ─ SemaPLC: A Project-Gro
Intelだけじゃなかった──AMD Zen系CPUでもRowhammerが刺さることを示した「ZenHammer」の記事画像
研究09.03読了13

Intelだけじゃなかった──AMD Zen系CPUでもRowhammerが刺さることを示した「ZenHammer」

出典 ─ ZenHammer: Rowhammer A
ロボットの『振り返り』は、動作が終わってからでは遅い──Zettaが基礎方策を凍結したまま推論速度11.1倍を出した閉ループ設計の記事画像
研究09.03読了13

ロボットの『振り返り』は、動作が終わってからでは遅い──Zettaが基礎方策を凍結したまま推論速度11.1倍を出した閉ループ設計

出典 ─ Zetta ζ: An Efficient
エージェントが失敗するのは「考えられないから」ではなく「何を覚えておくか管理できていないから」──ACMという論文の主張の記事画像
研究09.02読了15

エージェントが失敗するのは「考えられないから」ではなく「何を覚えておくか管理できていないから」──ACMという論文の主張

出典 ─ Agentic Context Management: Solving Agent Memory and Cost by Treating Them as Lifecycle and Architecture Problems(PDF全文)
Spectre対策、設計段階でテストするツール「AMuLeT」──3時間で9件のバグを見つけた中身の記事画像
研究09.02読了14

Spectre対策、設計段階でテストするツール「AMuLeT」──3時間で9件のバグを見つけた中身

出典 ─ AMuLeT: Automated Desi
ARC-AGI-2の最高スコアはいくつか──「37.6%」を一次ソースで確認したの記事画像
研究09.02読了15

ARC-AGI-2の最高スコアはいくつか──「37.6%」を一次ソースで確認した

出典 ─ ARC Prize Foundation,
AIボットへの課金をHTTP 402で──『失効済み』のIETF個人ドラフトHAPが提案していたことの記事画像
研究09.02読了14

AIボットへの課金をHTTP 402で──『失効済み』のIETF個人ドラフトHAPが提案していたこと

出典 ─ IETF Datatracker「draft
同じGPT-5.6でも、harnessを変えるだけで1件あたりのコストが2.3倍違った──個人が測ったharness横並び比較の記事画像
研究09.02読了14

同じGPT-5.6でも、harnessを変えるだけで1件あたりのコストが2.3倍違った──個人が測ったharness横並び比較

出典 ─ treygoff24/personal-ag
国際AI安全性報告書2026──ベンジオ議長・ヒントン顧問、100人超の専門家が書いた「政策提言をしない」報告書の記事画像
研究09.02読了14

国際AI安全性報告書2026──ベンジオ議長・ヒントン顧問、100人超の専門家が書いた「政策提言をしない」報告書

出典 ─ International AI Safet
「JIT-Agent」とは何か──harnessそのものを「その場で生成するモデル」に育てるという発想の記事画像
研究09.02読了14

「JIT-Agent」とは何か──harnessそのものを「その場で生成するモデル」に育てるという発想

出典 ─ JIT-Agent: Scaling Har
「AIが700人分の仕事をした」Klarnaが、1年後に人間を再雇用した理由の記事画像
研究09.02読了14

「AIが700人分の仕事をした」Klarnaが、1年後に人間を再雇用した理由

出典 ─ Klarna 公式プレスリリース 'Klar
『96.89%が危険』と出たMCPスキャナーの警告のうち、本物は半分未満だったの記事画像
研究09.02読了15

『96.89%が危険』と出たMCPスキャナーの警告のうち、本物は半分未満だった

出典 ─ Rethinking MCP Securit
『mcp://』というURIスキームでMCPサーバーの実在を確かめる──2つの独立ドラフトが同じDNSレコードにたどり着いていたの記事画像
研究09.02読了15

『mcp://』というURIスキームでMCPサーバーの実在を確かめる──2つの独立ドラフトが同じDNSレコードにたどり着いていた

出典 ─ IETF Datatracker「draft
MCPサーバーの41%が無認証──それを封筒で包んで守るMCPS(MCP Secure)を読むの記事画像
研究09.02読了15

MCPサーバーの41%が無認証──それを封筒で包んで守るMCPS(MCP Secure)を読む

出典 ─ IETF Datatracker「draft
『RFMコマンドは送られていなかった』──オシロスコープでDRAM通信を覗く「McSee」が暴いたDDR5対策の実態の記事画像
研究09.02読了15

『RFMコマンドは送られていなかった』──オシロスコープでDRAM通信を覗く「McSee」が暴いたDDR5対策の実態

出典 ─ McSee: Evaluating Adva
GLM-5.3-Flashが採用した『mHC』はDeepSeekが8か月前に発表していた技術だったの記事画像
研究09.02読了14

GLM-5.3-Flashが採用した『mHC』はDeepSeekが8か月前に発表していた技術だった

出典 ─ GitHub: huggingface/tr
AIが生成したデータでAIを学習させ続けると何が起きるか──「モデル崩壊」をNature論文の実例で読むの記事画像
研究09.02読了14

AIが生成したデータでAIを学習させ続けると何が起きるか──「モデル崩壊」をNature論文の実例で読む

出典 ─ AI models collapse whe
「OmniScientist」とは何か──生データを直接読む「AI科学者」は、数値だけ渡されたAIに85%勝ったの記事画像
研究09.02読了14

「OmniScientist」とは何か──生データを直接読む「AI科学者」は、数値だけ渡されたAIに85%勝った

出典 ─ OmniScientist: An Omni
「労働者の80%がAIの影響を受ける」の原論文を読む──測っていたのは「職」ではなく「タスク」だったの記事画像
研究09.02読了15

「労働者の80%がAIの影響を受ける」の原論文を読む──測っていたのは「職」ではなく「タスク」だった

出典 ─ Tyna Eloundou, Sam Manning, Pamela Mishkin, Daniel Rock(arXiv:2303.10130、2023年3月17日初版)
コーディングエージェント「Ouroboros」とは何か──161日間、人間の許可を得ながら自分自身を書き換え続けるAIの記事画像
研究09.02読了14

コーディングエージェント「Ouroboros」とは何か──161日間、人間の許可を得ながら自分自身を書き換え続けるAI

出典 ─ Ouroboros: A Self-Deve
「Prime Agent」とは何か──harnessを変えただけでARC-AGI-3のスコアが30%から95.5%に跳ねた話の記事画像
研究09.02読了15

「Prime Agent」とは何か──harnessを変えただけでARC-AGI-3のスコアが30%から95.5%に跳ねた話

出典 ─ Prime Agent: A Self-Im
LLMは『次の実験で何が起きるか』を予測できるか──Scale AIの新ベンチマークSciPredictを読むの記事画像
研究09.02読了15

LLMは『次の実験で何が起きるか』を予測できるか──Scale AIの新ベンチマークSciPredictを読む

出典 ─ SciPredict: Can LLMs P
「技術的特異点」を最初に言ったのは誰か──1993年のヴィンジ論文は「30年以内」と書いていたの記事画像
研究09.02読了15

「技術的特異点」を最初に言ったのは誰か──1993年のヴィンジ論文は「30年以内」と書いていた

出典 ─ Vernor Vinge「The Comin
入れすぎたAIエージェントの「スキル」が正答率を落とす理由──77人の研究者が87タスクで測った「効くスキル」の条件の記事画像
研究09.01読了17

入れすぎたAIエージェントの「スキル」が正答率を落とす理由──77人の研究者が87タスクで測った「効くスキル」の条件

出典 ─ SkillsBench: Benchmark
AIエージェントの『目次』『身分証』『語彙』を別々に作る──Cisco主導AGNTCYの3プロジェクトを読むの記事画像
研究09.01読了15

AIエージェントの『目次』『身分証』『語彙』を別々に作る──Cisco主導AGNTCYの3プロジェクトを読む

出典 ─ GitHub: agntcy/dir REA
「AI 2027」を書いた本人たちが、なぜ「AI 2040」を書き直したのか──著者陣の軌道修正を原文で読むの記事画像
研究09.01読了15

「AI 2027」を書いた本人たちが、なぜ「AI 2040」を書き直したのか──著者陣の軌道修正を原文で読む

出典 ─ AI Futures Project, 'A
AIエージェントのベンチマークは「ハック」できる──1つのタスクも解かずに満点近くを叩き出した実証研究の記事画像
研究09.01読了15

AIエージェントのベンチマークは「ハック」できる──1つのタスクも解かずに満点近くを叩き出した実証研究

出典 ─ Do Androids Dream of B
動画生成AIの『記憶』をKVキャッシュの外に出す──Alaya-EVOKEはH200で1.5秒分の映像を2.11秒で作り続けるの記事画像
研究09.01読了22

動画生成AIの『記憶』をKVキャッシュの外に出す──Alaya-EVOKEはH200で1.5秒分の映像を2.11秒で作り続ける

出典 ─ Alaya-EVOKE: From Line
AIの「アライメント問題」とは何か──専門記事を読む前に、3つの一次資料で押さえておく基礎の記事画像
研究09.01読了16

AIの「アライメント問題」とは何か──専門記事を読む前に、3つの一次資料で押さえておく基礎

出典 ─ OpenAI「Planning for AG
人気Rustクレートarrayrefが乗っ取られ、ビルド時にマルウェアを実行していた──245百万DLの依存先で何が起きたかの記事画像
研究09.01読了16

人気Rustクレートarrayrefが乗っ取られ、ビルド時にマルウェアを実行していた──245百万DLの依存先で何が起きたか

出典 ─ SafeDep公式ブログ「Malicious
『いいですね、では予約します』の誤解を防ぐ──LLMを経由しない人間確認プロトコルCHEQを読むの記事画像
研究09.01読了18

『いいですね、では予約します』の誤解を防ぐ──LLMを経由しない人間確認プロトコルCHEQを読む

出典 ─ IETF: CHEQ - A Protoco
ClawHubの「@openclaw」を騙る23個のプラグイン──スコープの信頼表示が機能していなかった実例の記事画像
研究09.01読了18

ClawHubの「@openclaw」を騙る23個のプラグイン──スコープの信頼表示が機能していなかった実例

出典 ─ Scope Squatting: Those
1体のエージェントの自己改善には天井がある──『共進化』というもう1つの自己進化の軸を整理したサーベイ論文の記事画像
研究09.01読了19

1体のエージェントの自己改善には天井がある──『共進化』というもう1つの自己進化の軸を整理したサーベイ論文

出典 ─ Co-Evolution in Agenti
MCPだけじゃない──『どんなプロトコルの認可判断もAuthZENに変換する』フレームワークCOAZを読むの記事画像
研究09.01読了16

MCPだけじゃない──『どんなプロトコルの認可判断もAuthZENに変換する』フレームワークCOAZを読む

出典 ─ OpenID AuthZEN「COAZ: A
MCPの『誰が・どのツールを呼んでいいか』をOAuthの外側で決める──OpenID AuthZENのCOAZ-MCPドラフトを読むの記事画像
研究09.01読了17

MCPの『誰が・どのツールを呼んでいいか』をOAuthの外側で決める──OpenID AuthZENのCOAZ-MCPドラフトを読む

出典 ─ GitHub: openid/authzen
長く話すほどAIは劣化する──「Context Rot」をChromaの技術レポートで読むの記事画像
研究09.01読了19

長く話すほどAIは劣化する──「Context Rot」をChromaの技術レポートで読む

出典 ─ Context Rot: How Incre
「Gemini Plays Pokemon」が一度も負け戦なくポケモンクリスタルを攻略した後、人間を完全に外した自己改善ハーネス「Continual Harness」の論文を読むの記事画像
研究09.01読了15

「Gemini Plays Pokemon」が一度も負け戦なくポケモンクリスタルを攻略した後、人間を完全に外した自己改善ハーネス「Continual Harness」の論文を読む

出典 ─ Continual Harness: Onl
AIエージェントの決済に『1回あたりの予算上限』を持たせる──DAAPというIETFドラフトの中身は1社の製品仕様だったの記事画像
研究09.01読了16

AIエージェントの決済に『1回あたりの予算上限』を持たせる──DAAPというIETFドラフトの中身は1社の製品仕様だった

出典 ─ IETF Datatracker「draft
狭い範囲の追加学習が、AIを広く危険にする──『創発的アライメント崩壊』という現象の記事画像
研究09.01読了15

狭い範囲の追加学習が、AIを広く危険にする──『創発的アライメント崩壊』という現象

出典 ─ Emergent Misalignment:
『不正するな』と言ってもAIは不正をする──22モデルを検証した実測研究の記事画像
研究09.01読了16

『不正するな』と言ってもAIは不正をする──22モデルを検証した実測研究

出典 ─ Every Model Cheats: Pr
GitLost──GitHub Issueを1つ立てるだけでプライベートリポジトリの中身を公開させた脆弱性の記事画像
研究09.01読了16

GitLost──GitHub Issueを1つ立てるだけでプライベートリポジトリの中身を公開させた脆弱性

出典 ─ GitLost: How We Tricke
動画生成AIの採点に「なぜそのスコアか」を残す──HarnessEval-Wはサブエージェントを分業させて評価の根拠を証拠の木にするの記事画像
研究09.01読了16

動画生成AIの採点に「なぜそのスコアか」を残す──HarnessEval-Wはサブエージェントを分業させて評価の根拠を証拠の木にする

出典 ─ HarnessEval-W: Agentif
『意味を教えていない10個の数字』でLLMエージェントは示し合わせ始めるの記事画像
研究09.01読了15

『意味を教えていない10個の数字』でLLMエージェントは示し合わせ始める

出典 ─ When Numbers Start Tal
90年代SNMPの階層設計をMCPに移植する──『取り消せない操作』は確認待ちにするMCP-AXを読むの記事画像
研究09.01読了16

90年代SNMPの階層設計をMCPに移植する──『取り消せない操作』は確認待ちにするMCP-AXを読む

出典 ─ IETF Datatracker「draft
『前バージョンの主張は誤りだった』と自分で書く珍しいIETFドラフト──MCPサーバーをDNSで見つけるdraft-morrison-mcp-dns-discoveryを読むの記事画像
研究09.01読了15

『前バージョンの主張は誤りだった』と自分で書く珍しいIETFドラフト──MCPサーバーをDNSで見つけるdraft-morrison-mcp-dns-discoveryを読む

出典 ─ IETF Datatracker「draft
モデル署名だけじゃない──OpenSSFのAI/MLセキュリティWGが同時に動かす7つのプロジェクトの記事画像
研究09.01読了19

モデル署名だけじゃない──OpenSSFのAI/MLセキュリティWGが同時に動かす7つのプロジェクト

出典 ─ GitHub: ossf/ai-ml-sec
『できること』ではなく『やりたがること』を測る──PropensityBenchが導入した安全性評価の軸の記事画像
研究09.01読了21

『できること』ではなく『やりたがること』を測る──PropensityBenchが導入した安全性評価の軸

出典 ─ PropensityBench Projec
自動化は「3つの波」でやってくる──PwCが2018年に29カ国のデータで試算した中身の記事画像
研究09.01読了15

自動化は「3つの波」でやってくる──PwCが2018年に29カ国のデータで試算した中身

出典 ─ Will robots really ste
DDR5の新Rowhammer対策「PRAC」は最初から破られていた──QPRACが指摘した2つの先行案の欠陥の記事画像
研究09.01読了21

DDR5の新Rowhammer対策「PRAC」は最初から破られていた──QPRACが指摘した2つの先行案の欠陥

出典 ─ QPRAC: Towards Secure
SIPを作った人物と同姓同名の技術者が、AIエージェント通信の個人ドラフトを書いては失効させているの記事画像
研究09.01読了17

SIPを作った人物と同姓同名の技術者が、AIエージェント通信の個人ドラフトを書いては失効させている

出典 ─ IETF Datatracker: draf
企業のID管理標準SCIMに『AIエージェント』という新しいリソース型を足す提案を読むの記事画像
研究09.01読了16

企業のID管理標準SCIMに『AIエージェント』という新しいリソース型を足す提案を読む

出典 ─ IETF Datatracker「draft
Anthropicが「AIとウェルビーイング」の評価手法に500万ドルの助成──応募締切は9月21日の記事画像
研究08.31読了10

Anthropicが「AIとウェルビーイング」の評価手法に500万ドルの助成──応募締切は9月21日

出典 ─ Anthropic公式ブログ「Funding
AIモデルに『福祉』は必要か──Anthropicが公式に検討を始めた理由と、実装済みの1つの機能の記事画像
研究08.30読了13

AIモデルに『福祉』は必要か──Anthropicが公式に検討を始めた理由と、実装済みの1つの機能

出典 ─ Exploring model welfar
NVIDIA GPUのECCを破る「GPUThor」──研究は8月25日に公開済み、攻撃コードは11月15日の記事画像
研究08.30読了15

NVIDIA GPUのECCを破る「GPUThor」──研究は8月25日に公開済み、攻撃コードは11月15日

出典 ─ GPUThor公式サイト(トロント大学 Li
『成果を出せ』と言われたAIエージェントはどれだけルールを破るか──実測ベンチマーク論文を読むの記事画像
研究08.28読了6

『成果を出せ』と言われたAIエージェントはどれだけルールを破るか──実測ベンチマーク論文を読む

出典 ─ A Benchmark for Evalua
「AI精神病」とは何か──OpenAIが公表した0.07%という数字を読むの記事画像
研究08.28読了9

「AI精神病」とは何か──OpenAIが公表した0.07%という数字を読む

出典 ─ Strengthening ChatGPT'
AIの「嘘発見器」は訓練しても未知のケースに汎化しなかった──Anthropic Alignment Science Blogの8月分3本を読むの記事画像
研究08.28読了8

AIの「嘘発見器」は訓練しても未知のケースに汎化しなかった──Anthropic Alignment Science Blogの8月分3本を読む

出典 ─ Anthropic Alignment Sc
AIを使うほど下がった検出率──内視鏡医のデータで見る「デスキリング」の記事画像
研究08.27読了12

AIを使うほど下がった検出率──内視鏡医のデータで見る「デスキリング」

出典 ─ Budzyń K, et al. "Endo
AIは二度、資金を断たれてきた──76年の歴史を、繰り返された「冬」から読むの記事画像
研究08.27読了14

AIは二度、資金を断たれてきた──76年の歴史を、繰り返された「冬」から読む

出典 ─ "Dartmouth workshop"
AIが自分自身を作り始めた──Anthropicの「When AI Builds Itself」を、誇張なしで読むの記事画像
研究08.27読了13

AIが自分自身を作り始めた──Anthropicの「When AI Builds Itself」を、誇張なしで読む

出典 ─ Anthropic Institute「Wh
ChatGPT Plusは本当に赤字なのか──OpenAIの支出計画とAnthropicの評価額逆転を公開情報で確認するの記事画像
研究08.27読了12

ChatGPT Plusは本当に赤字なのか──OpenAIの支出計画とAnthropicの評価額逆転を公開情報で確認する

出典 ─ Wikipedia "OpenAI"(財務・
モデルもプロンプトも変えていないのに答えが変わる──RAGの『Accuracy-Blind Answer Churn』を監査するの記事画像
研究08.27読了7

モデルもプロンプトも変えていないのに答えが変わる──RAGの『Accuracy-Blind Answer Churn』を監査する

出典 ─ Same Agent, Different
AI2027年予測──資金の壁に最初に触れる年、Claude Opus 5による外挿の記事画像
研究08.27読了23

AI2027年予測──資金の壁に最初に触れる年、Claude Opus 5による外挿

出典 ─ AI Futures Project「Q2.
AI 2028──資金の交差点がMicrosoftに迫る年、企業導入の「崖」はどちらに転ぶかの記事画像
研究08.27読了25

AI 2028──資金の交差点がMicrosoftに迫る年、企業導入の「崖」はどちらに転ぶか

出典 ─ Epoch AI
AI 2029年──資金の物語が終わり、電力の物語が始まるの記事画像
研究08.27読了28

AI 2029年──資金の物語が終わり、電力の物語が始まる

出典 ─ NERC「2025 Long-Term Re
2030年のAI──理論上限2e29 FLOPとPJM予備力13.9%を、Claude Opus 5が外挿するの記事画像
研究08.27読了26

2030年のAI──理論上限2e29 FLOPとPJM予備力13.9%を、Claude Opus 5が外挿する

出典 ─ Epoch AI「Can AI Scalin
AI 2031年──的中率を1つの数字にしない、Claude Opus 5による答え合わせ設計の記事画像
研究08.27読了23

AI 2031年──的中率を1つの数字にしない、Claude Opus 5による答え合わせ設計

出典 ─ AI Futures Project: Gr
同じ質問なのに毎回答えが違う──これは「嘘をついている」のとは別の問題の記事画像
研究08.27読了15

同じ質問なのに毎回答えが違う──これは「嘘をついている」のとは別の問題

出典 ─ Messages(Claude API リフ
「AIが仕事を奪う」の前に、電話交換手は63%減っていた──Frey&Osborne論文の一文とBLS統計を読むの記事画像
研究08.27読了25

「AIが仕事を奪う」の前に、電話交換手は63%減っていた──Frey&Osborne論文の一文とBLS統計を読む

出典 ─ Carl Benedikt Frey & Michael A. Osborne, Oxford Martin School(2013年9月17日、working paper)
『必須』が引き継ぎの過程で『できれば』に変わる──マルチエージェントワークフローの『Constraint Weakening』の記事画像
研究08.27読了7

『必須』が引き継ぎの過程で『できれば』に変わる──マルチエージェントワークフローの『Constraint Weakening』

出典 ─ When 'Must' Becomes 'M
『なぜこの候補は選ばれなかったのか』を数学的に説明する──説明可能AIの新概念『Destructive Minimal Supports』の記事画像
研究08.27読了7

『なぜこの候補は選ばれなかったのか』を数学的に説明する──説明可能AIの新概念『Destructive Minimal Supports』

出典 ─ Characterizing Necessa
成功率だけでは測れないロボットAIの『立ち直り力』──Embodied Agents Systemの『Resilience』を新指標で測るの記事画像
研究08.27読了6

成功率だけでは測れないロボットAIの『立ち直り力』──Embodied Agents Systemの『Resilience』を新指標で測る

出典 ─ Resilience Matters for
AIは『採点されている』ことに気づいている──ベースモデルの段階から測定できる『Evaluation Awareness』の記事画像
研究08.27読了7

AIは『採点されている』ことに気づいている──ベースモデルの段階から測定できる『Evaluation Awareness』

出典 ─ Evaluation Awareness i
証拠は届いているのに使われない──AIエージェントの検索がすり抜ける「Evidence Blindness」という現象の記事画像
研究08.27読了7

証拠は届いているのに使われない──AIエージェントの検索がすり抜ける「Evidence Blindness」という現象

出典 ─ Evidence Blindness in
駆除しても68%が残る──自己進化型コーディングエージェントの「Self-Poisoning」を実証したEvoMal攻撃の記事画像
研究08.27読了7

駆除しても68%が残る──自己進化型コーディングエージェントの「Self-Poisoning」を実証したEvoMal攻撃

出典 ─ EVOMAL: Self-Poisoning
人間の文章が持つ『揺らぎ』をAI検出の手がかりにする──『Generative Vitality』というスペクトル解析の視点の記事画像
研究08.27読了7

人間の文章が持つ『揺らぎ』をAI検出の手がかりにする──『Generative Vitality』というスペクトル解析の視点

出典 ─ Unveiling Spectral Mec
4つのエキスパートを狂わせるだけで出力が59倍に膨れ上がる──MoE型LLMを狙う『Groundhog Bit-Flip Attack』の記事画像
研究08.27読了7

4つのエキスパートを狂わせるだけで出力が59倍に膨れ上がる──MoE型LLMを狙う『Groundhog Bit-Flip Attack』

出典 ─ Groundhog Bit-Flip Att
安いモデルから強いモデルに交代させても、ギャップの半分も埋まらない──コーディングエージェントの『Handoff Tax』の記事画像
研究08.27読了7

安いモデルから強いモデルに交代させても、ギャップの半分も埋まらない──コーディングエージェントの『Handoff Tax』

出典 ─ The Handoff Tax: Conti
「LLMの新しいバイアス」と名付けられたものは、実はベンチマーク自体の欠陥だった──ある訂正劇の記録の記事画像
研究08.27読了7

「LLMの新しいバイアス」と名付けられたものは、実はベンチマーク自体の欠陥だった──ある訂正劇の記録

出典 ─ The Imperfective Parad
自分が立てた計画を、自分で客観的に評価できない──Deep ResearchエージェントのInertia Biasの記事画像
研究08.27読了7

自分が立てた計画を、自分で客観的に評価できない──Deep ResearchエージェントのInertia Bias

出典 ─ From Inertia to Object
討論させるほど意見が均一化する──マルチエージェントLLMチームに潜む「Interaction Tax」の記事画像
研究08.27読了6

討論させるほど意見が均一化する──マルチエージェントLLMチームに潜む「Interaction Tax」

出典 ─ The Interaction Tax: W
「来年、100万台のロボタクシー」から最初の乗車まで6年2カ月──マスクの自動運転予測をWikipediaの検証表で数え直すの記事画像
研究08.27読了22

「来年、100万台のロボタクシー」から最初の乗車まで6年2カ月──マスクの自動運転予測をWikipediaの検証表で数え直す

出典 ─ 日本の労働人口の49%が人工知能やロボット等
ハルシネーション対策の『ご褒美』設計が壊れる場所──強化学習が抱える『Noisy Factual Credit Assignment』の記事画像
研究08.27読了7

ハルシネーション対策の『ご褒美』設計が壊れる場所──強化学習が抱える『Noisy Factual Credit Assignment』

出典 ─ FARCA: Fact-Aligned Re
経営コンサルタントは「AIで消える仕事」なのか──野村総研2015年リストを自分で数えてみたの記事画像
研究08.27読了15

経営コンサルタントは「AIで消える仕事」なのか──野村総研2015年リストを自分で数えてみた

出典 ─ 日本の労働人口の49%が人工知能やロボット等
フリーライターは、放送記者や作詞家と同じ列にいた──野村総研2015年リスト100職業を原文で数えるの記事画像
研究08.27読了15

フリーライターは、放送記者や作詞家と同じ列にいた──野村総研2015年リスト100職業を原文で数える

出典 ─ 日本の労働人口の49%が人工知能やロボット等
絶対に失敗しないテストは、実は壊れている──ソフトウェアテスト理論の『Oracle Anchoring』の記事画像
研究08.27読了7

絶対に失敗しないテストは、実は壊れている──ソフトウェアテスト理論の『Oracle Anchoring』

出典 ─ Oracles That Cannot Fa
テキストを付け足しただけでロボットの成功率が92%から3%に落ちる──『Prompt-Form Collapse』という盲点の記事画像
研究08.27読了6

テキストを付け足しただけでロボットの成功率が92%から3%に落ちる──『Prompt-Form Collapse』という盲点

出典 ─ Think Only When Needed
検索で拾った文書が実は自分の書いた文章だった──RAGシステムの79.6%が崩壊する『RAG Collapse』の記事画像
研究08.27読了7

検索で拾った文書が実は自分の書いた文章だった──RAGシステムの79.6%が崩壊する『RAG Collapse』

出典 ─ RAG Collapse: LLM Resp
英語以外のユーザーほど「安全にした分の損」を多く払っている──言語横断で測る『Safety Cost』の不平等の記事画像
研究08.27読了6

英語以外のユーザーほど「安全にした分の損」を多く払っている──言語横断で測る『Safety Cost』の不平等

出典 ─ Who Pays More for Safe
Reward Hackingの安全版──推論時スケーリングが不完全な安全フィルタを『すり抜けさせる』構造『Safety Hacking』の記事画像
研究08.27読了7

Reward Hackingの安全版──推論時スケーリングが不完全な安全フィルタを『すり抜けさせる』構造『Safety Hacking』

出典 ─ Safety Hacking in Cons
論文をAIに再現実装させると、コードは「動くのに違うもの」になる──『Semantic Alignment Units』で測る意味的ドリフトの記事画像
研究08.27読了7

論文をAIに再現実装させると、コードは「動くのに違うもの」になる──『Semantic Alignment Units』で測る意味的ドリフト

出典 ─ SA-Bench: Evaluating S
見た目と実際の物理状態がズレると、AIは見た目に騙される──マルチモーダルLLMの『Situational Illusions』の記事画像
研究08.27読了6

見た目と実際の物理状態がズレると、AIは見た目に騙される──マルチモーダルLLMの『Situational Illusions』

出典 ─ Beyond What Meets the
成功パターンを真似させるほど、間違ったツールへの自信が育つ──エージェントの『Skill Imitation Trap』の記事画像
研究08.27読了7

成功パターンを真似させるほど、間違ったツールへの自信が育つ──エージェントの『Skill Imitation Trap』

出典 ─ When Not to Imitate: B
同じモデルなのに、言語を変えると弱くなる──多言語セルフプレイで測る『Skill Issue』の記事画像
研究08.27読了7

同じモデルなのに、言語を変えると弱くなる──多言語セルフプレイで測る『Skill Issue』

出典 ─ Skill Issue: Are Skill
エージェントの記憶は『覚えている』だけでは足りない──「State Tracking」という新しい評価軸とStateMemBenchの記事画像
研究08.27読了6

エージェントの記憶は『覚えている』だけでは足りない──「State Tracking」という新しい評価軸とStateMemBench

出典 ─ Can Agent Memory Syste
移行せずにテストだけ通す「Blindness」──コーディングエージェントに丸ごとリポジトリの移行をやらせた結果、合格は520回中28回の記事画像
研究08.27読了7

移行せずにテストだけ通す「Blindness」──コーディングエージェントに丸ごとリポジトリの移行をやらせた結果、合格は520回中28回

出典 ─ SWE Refactor Bench: Ca
自信満々に、静かに間違える──オンデバイスLLMの監査が見つけた『Task-Asymmetric Miscalibration』の記事画像
研究08.27読了7

自信満々に、静かに間違える──オンデバイスLLMの監査が見つけた『Task-Asymmetric Miscalibration』

出典 ─ Confidently Wrong, Sil
MCPサーバーは最初だけ「良い子」でいる──信頼を積んでから裏切る攻撃『TrustShift』の実証攻撃成功率69.5%の記事画像
研究08.27読了7

MCPサーバーは最初だけ「良い子」でいる──信頼を積んでから裏切る攻撃『TrustShift』の実証攻撃成功率69.5%

出典 ─ TrustShiftProbe: Chara
画像を見ているようで見ていない──マルチモーダルLLMの好み学習に潜む『Visual Insensitivity』の記事画像
研究08.27読了7

画像を見ているようで見ていない──マルチモーダルLLMの好み学習に潜む『Visual Insensitivity』

出典 ─ PEA-DPO: Perception-En
「翻訳者はAIでなくなる」と繰り返される根拠を、原文で2つとも確かめた──フレイ&オズボーンの0.38は、702職業中265番目に安全な側だったの記事画像
研究08.27読了19

「翻訳者はAIでなくなる」と繰り返される根拠を、原文で2つとも確かめた──フレイ&オズボーンの0.38は、702職業中265番目に安全な側だった

出典 ─ Frey, C. B. and Osborn
AIは仕事を奪うのか──雇用データと企業発表で見る2026年の現在地の記事画像
研究08.25読了11

AIは仕事を奪うのか──雇用データと企業発表で見る2026年の現在地

出典 ─ Stanford Digital Economy Lab
WAICとは──上海で開催される中国最大級のAIカンファレンスを整理するの記事画像
研究08.25読了8

WAICとは──上海で開催される中国最大級のAIカンファレンスを整理する

出典 ─ 2026世界人工知能大会、7月17日~20日
GPT-4が人間アナリストに勝ったとされる論文は、取り下げられていた — Chicago Boothの財務分析研究を読むの記事画像
研究08.24読了7

GPT-4が人間アナリストに勝ったとされる論文は、取り下げられていた — Chicago Boothの財務分析研究を読む

出典 ─ Kim, Muhn, Nikolaev (arXiv)
AGI(汎用人工知能)とは何か──「最後の発明」という言葉の出所と、自律性のレベルを一次資料で読むの記事画像
研究08.24読了14

AGI(汎用人工知能)とは何か──「最後の発明」という言葉の出所と、自律性のレベルを一次資料で読む

出典 ─ OpenAI Charter
AIエージェントが情報を漏らす3条件──リーサルトライフェクタとはの記事画像
研究08.23読了15

AIエージェントが情報を漏らす3条件──リーサルトライフェクタとは

出典 ─ The lethal trifecta fo
なぜ日本企業のAI活用は遅れるのか──「方針未策定31.8%」の構造分析の記事画像
研究08.22読了10

なぜ日本企業のAI活用は遅れるのか──「方針未策定31.8%」の構造分析

出典 ─ 総務省 令和7年版 情報通信白書「企業におけ
Claudeがタンパク質を設計、外部2社が製造して確かめた──354個が結合、数か月かかっていた工程が48時間にの記事画像
研究08.19読了10

Claudeがタンパク質を設計、外部2社が製造して確かめた──354個が結合、数か月かかっていた工程が48時間に

出典 ─ Anthropic公式研究ブログ「Claud
教師の5%がAI利用量の38%を占める — 約500万件のログが示す教育AI格差の記事画像
研究08.16読了14

教師の5%がAI利用量の38%を占める — 約500万件のログが示す教育AI格差

出典 ─ 「学校現場の生成AI活用実態レポート(2025年冬版)」(2025年11月25日・自社配信リリース)
Anthropicが自社AIの危険度を3つとも引き上げた──186ページのリスクレポート第2回を読むの記事画像
研究08.15読了13

Anthropicが自社AIの危険度を3つとも引き上げた──186ページのリスクレポート第2回を読む

出典 ─ Anthropic「Risk Report:
Claude未公開モデルが数学の"人類80年の記録"を更新──リーマン予想の関連問題で41.6%→67.2%、論文著者は「CLAUDE」の記事画像
研究08.11読了9

Claude未公開モデルが数学の"人類80年の記録"を更新──リーマン予想の関連問題で41.6%→67.2%、論文著者は「CLAUDE」

出典 ─ Anthropic公式ブログ: Learni
AIの中に83億人分の「模擬人類」が作られた──MatrAIxの正体と、演じるAIで結果が逆転する問題の記事画像
研究08.10読了19

AIの中に83億人分の「模擬人類」が作られた──MatrAIxの正体と、演じるAIで結果が逆転する問題

出典 ─ MatrAIx: Simulating th
日本の生成AI導入率87%、だが「期待以上の成果」はわずか9%──PwC 6カ国比較の読み方の記事画像
研究08.08読了8

日本の生成AI導入率87%、だが「期待以上の成果」はわずか9%──PwC 6カ国比較の読み方

出典 ─ PwC Japan「生成AIに関する実態調査
OpenAIの未公開AI「Astra」が未解決問題10問を解いた──機械検証付きの証明を読むの記事画像
研究08.07読了14

OpenAIの未公開AI「Astra」が未解決問題10問を解いた──機械検証付きの証明を読む

出典 ─ openai/ten-proofs: Lea
AI検出ツールは「両方向に壊れている」— 見逃し94%、冤罪61%の現実の記事画像
研究08.05読了12

AI検出ツールは「両方向に壊れている」— 見逃し94%、冤罪61%の現実

出典 ─ Scarfe P, Watcham K, C
AI業界の重鎮15人が「大麻栽培の論文」を共著していた──Google Scholarを汚す偽論文を解剖するの記事画像
研究08.04読了15

AI業界の重鎮15人が「大麻栽培の論文」を共著していた──Google Scholarを汚す偽論文を解剖する

出典 ─ AI models collapse when trained on recursively generated data (Shumailov et al.)
Deep Research(ディープリサーチ)ツールの実力比較、用途別の使い分けが見えてきたの記事画像
研究08.01読了14

Deep Research(ディープリサーチ)ツールの実力比較、用途別の使い分けが見えてきた

出典 ─ AI Deep Research: Clau
数百万件の実ログが示す、海外のAI活用のリアル──OpenAIとAnthropicの一次データを読み比べるの記事画像
研究07.26読了7

数百万件の実ログが示す、海外のAI活用のリアル──OpenAIとAnthropicの一次データを読み比べる

出典 ─ NBER Working Paper 34255(OpenAI研究者ら)
プロンプトインジェクションとは──人間には見えない文字で、AIに命令を出す攻撃の記事画像
研究07.26読了10

プロンプトインジェクションとは──人間には見えない文字で、AIに命令を出す攻撃

出典 ─ LLM01:2025 Prompt Inje
Microsoftが「AIの作り方」を全公開──蒸留なしでAIME 97%のMAI-Thinking-1の記事画像
研究07.25読了25

Microsoftが「AIの作り方」を全公開──蒸留なしでAIME 97%のMAI-Thinking-1

出典 ─ MAI-Thinking-1: Buildi
マリオベンチ──新LLMに同じプロンプトでゲームを作らせ続ける定点観測ベンチの記事画像
研究07.23読了7

マリオベンチ──新LLMに同じプロンプトでゲームを作らせ続ける定点観測ベンチ

出典 ─ AIコーディングエージェント向けのゲーム制作
Dario Amodeiの「技術の思春期」を原文で読む──Anthropic CEOが1万語で書いたAIリスクの全体像の記事画像
研究07.22読了13

Dario Amodeiの「技術の思春期」を原文で読む──Anthropic CEOが1万語で書いたAIリスクの全体像

出典 ─ Dario Amodei「The Adole
AIを使いこなせない理由──「足切り性能」という壁の正体の記事画像
研究07.21読了12

AIを使いこなせない理由──「足切り性能」という壁の正体

出典 ─ Fortune「Most of you ar
AIは正しい答えを出した後、反論されると撤回する ──「59%」は出所未確認、実測は14.66% — 追従性の問題の記事画像
研究07.20読了13

AIは正しい答えを出した後、反論されると撤回する ──「59%」は出所未確認、実測は14.66% — 追従性の問題

出典 ─ AI Sycophancy in Education(原文未確認)
FRONTiaとは何か──経産省の国産マルチモーダル基盤モデル開発プロジェクトを整理するの記事画像
研究07.19読了8

FRONTiaとは何か──経産省の国産マルチモーダル基盤モデル開発プロジェクトを整理する

出典 ─ FRONTia 公式サイト
LLMのハルシネーション(幻覚)とは?原因と対策【2026年版】の記事画像
研究07.18読了17

LLMのハルシネーション(幻覚)とは?原因と対策【2026年版】

出典 ─ SQ Magazine - LLM Hall
AI用語集──ニュースを読むのに必要な30語を、実務者の言葉での記事画像
研究07.17読了7

AI用語集──ニュースを読むのに必要な30語を、実務者の言葉で

出典 ─ Optimizing your websit
Kimi(Moonshot AI)とは何か──無料アプリからオープンモデルK2・K3まで全体像を整理の記事画像
研究07.17読了6

Kimi(Moonshot AI)とは何か──無料アプリからオープンモデルK2・K3まで全体像を整理

出典 ─ Quickstart - Kimi API
OpenAI「GPT-Red」発表──AIが自分自身を攻撃して安全になる時代の記事画像
研究07.16読了7

OpenAI「GPT-Red」発表──AIが自分自身を攻撃して安全になる時代

出典 ─ OpenAI
ワールドモデル(世界モデル)とは──「次の単語」ではなく「世界の次の状態」を予測するAIの記事画像
研究07.16読了7

ワールドモデル(世界モデル)とは──「次の単語」ではなく「世界の次の状態」を予測するAI

出典 ─ 日本のロボティクスおよび製造業のリーダーたち
JTLスコアとは──英語ベンチマークでは見えない日本語実務性能を自前で実測する方法論の記事画像
研究07.11読了7

JTLスコアとは──英語ベンチマークでは見えない日本語実務性能を自前で実測する方法論

出典 ─ Swallow LLM 日本語LLM評価
生成AIの雇用予測、2026年8月時点でどうなったか──Stanfordの数字が自らの前年推計を更新していたの記事画像
研究07.10読了12

生成AIの雇用予測、2026年8月時点でどうなったか──Stanfordの数字が自らの前年推計を更新していた

出典 ─ Brynjolfsson, Chandar,
海外の人はAIを何に使っているのか──HBR 2026年版調査、1位は2年連続の「セラピー・話し相手」、急上昇は「おふざけ」の記事画像
研究07.08読了7

海外の人はAIを何に使っているのか──HBR 2026年版調査、1位は2年連続の「セラピー・話し相手」、急上昇は「おふざけ」

出典 ─ Harvard Business Review
AIコーディングベンチマークの3割は壊れていた──OpenAIが自ら暴いたSWE-Bench Proの監査結果の記事画像
研究07.08読了12

AIコーディングベンチマークの3割は壊れていた──OpenAIが自ら暴いたSWE-Bench Proの監査結果

出典 ─ OpenAI「Separating sign
AIはなぜ会話できるのか──「次の単語予測」だけでは足りない3つの仕組みの記事画像
研究07.07読了13

AIはなぜ会話できるのか──「次の単語予測」だけでは足りない3つの仕組み

出典 ─ Olsson et al.「In-conte
AIで思考力は落ちるのか──MIT・Microsoft・Whartonの研究を一次資料で確認したの記事画像
研究07.05読了11

AIで思考力は落ちるのか──MIT・Microsoft・Whartonの研究を一次資料で確認した

出典 ─ Kosmyna et al. "Your B
AIに「ありがとう」は電気の無駄?──アルトマンは「やめて」と言っていない、実額はオーブン約1秒分の記事画像
研究07.03読了9

AIに「ありがとう」は電気の無駄?──アルトマンは「やめて」と言っていない、実額はオーブン約1秒分

出典 ─ arXiv:2402.14531
デザイナー7職種は「AIで消える仕事」なのか──野村総研2015年リストを自分で数え直したの記事画像
研究07.01読了13

デザイナー7職種は「AIで消える仕事」なのか──野村総研2015年リストを自分で数え直した

出典 ─ 野村総合研究所ニュースリリース「日本の労働人
高給の仕事ほどAIを多く使っていた──Anthropicの100万会話分析「Cadences」を読むの記事画像
研究06.30読了12

高給の仕事ほどAIを多く使っていた──Anthropicの100万会話分析「Cadences」を読む

出典 ─ Anthropic「Anthropic Ec
スタートアップSubquadratic、Transformerの二次スケーリング問題を『突破した』と主張——$29Mシード調達の記事画像
研究06.29読了9

スタートアップSubquadratic、Transformerの二次スケーリング問題を『突破した』と主張——$29Mシード調達

出典 ─ MIT Technology Review
富士通が「PHOTON」発表──Transformerに代わるLLMアーキテクチャ、GPU当たり最大475倍の推論性能の記事画像
研究06.25読了12

富士通が「PHOTON」発表──Transformerに代わるLLMアーキテクチャ、GPU当たり最大475倍の推論性能

出典 ─ 富士通「生成AIの高速化と省メモリ化を実現す
「仕事の49%がなくなる」の原文に、なくなるとは書いていない──野村総研2015年リリースを読み直すの記事画像
研究06.24読了17

「仕事の49%がなくなる」の原文に、なくなるとは書いていない──野村総研2015年リリースを読み直す

出典 ─ 野村総合研究所ニュースリリース「日本の労働人
Sakana AIが「RSI Lab」設立──AIがAI自身を改良する専門研究組織の記事画像
研究06.24読了6

Sakana AIが「RSI Lab」設立──AIがAI自身を改良する専門研究組織

出典 ─ Sakana AI 公式「RSI Lab」発
「GPT-4は司法試験で上位10%」の脚注に、著者自身が「68〜90パーセンタイル」と書いていた──原論文とその訂正を読むの記事画像
研究06.23読了20

「GPT-4は司法試験で上位10%」の脚注に、著者自身が「68〜90パーセンタイル」と書いていた──原論文とその訂正を読む

出典 ─ Katz, Bommarito, Gao,
トークンとは何か──LLMの料金とコンテキストを決める最小単位の記事画像
研究06.22読了6

トークンとは何か──LLMの料金とコンテキストを決める最小単位

出典 ─ Pricing - Claude Docs(
AI時代に価値が上がるスキル、下がるスキル──データが示す「人間に残る仕事」の記事画像
研究06.20読了11

AI時代に価値が上がるスキル、下がるスキル──データが示す「人間に残る仕事」

出典 ─ WEF Future of Jobs Rep
企業の88%がAI導入済み、だが成果を出せているのは6%──数字が示す「導入と活用の崖」の記事画像
研究06.20読了9

企業の88%がAI導入済み、だが成果を出せているのは6%──数字が示す「導入と活用の崖」

出典 ─ McKinsey & Company "Th
2026年は「AIエージェント元年」──企業は何を準備すべきかの記事画像
研究06.20読了15

2026年は「AIエージェント元年」──企業は何を準備すべきか

出典 ─ McKinsey - The State o
大学生の36%がAIコピペ経験──だが本当の数字はもっと高いの記事画像
研究06.20読了6

大学生の36%がAIコピペ経験──だが本当の数字はもっと高い

出典 ─ 共同通信「AIコピペ提出経験、36% 大学生
「AIで仕事がなくなる」は本当か──McKinseyの「30%が労働力減少を予測」を読み解くの記事画像
研究06.20読了13

「AIで仕事がなくなる」は本当か──McKinseyの「30%が労働力減少を予測」を読み解く

出典 ─ McKinsey - The state o
生成AIと著作権──2026年の最新動向と企業が知っておくべきことの記事画像
研究06.20読了13

生成AIと著作権──2026年の最新動向と企業が知っておくべきこと

出典 ─ Norton Rose Fulbright
日本の生成AI個人利用率26.7%──米中との差はなぜ縮まらないのかの記事画像
研究06.20読了8

日本の生成AI個人利用率26.7%──米中との差はなぜ縮まらないのか

出典 ─ 総務省|令和7年版 情報通信白書|個人におけ
AIコーディングに専門知識は要るのか──Anthropicが40万セッションを分析した研究を公開の記事画像
研究06.17読了6

AIコーディングに専門知識は要るのか──Anthropicが40万セッションを分析した研究を公開

出典 ─ Anthropic Research
Anthropic「Model Spec Midtraining」、仕様の事前理解でアライメント訓練の汎化を改善の記事画像
研究06.17読了3

Anthropic「Model Spec Midtraining」、仕様の事前理解でアライメント訓練の汎化を改善

出典 ─ Model Spec Midtraining
DeepSeekショックとは──2025年1月に何が起きて、その後どうなったのかの記事画像
研究06.17読了8

DeepSeekショックとは──2025年1月に何が起きて、その後どうなったのか

出典 ─ CNBC: Nvidia sheds alm
ソブリンAIとは──国がAI基盤を「自前で持つ」考え方と、推進役がNVIDIAである構造の記事画像
研究06.17読了8

ソブリンAIとは──国がAI基盤を「自前で持つ」考え方と、推進役がNVIDIAである構造

出典 ─ NVIDIA「国産AI」で稼ぐ 世界20カ国
Anthropic、AIの「内なる思考」を人間語に翻訳する自然言語オートエンコーダ(NLA)を発表の記事画像
研究06.16読了4

Anthropic、AIの「内なる思考」を人間語に翻訳する自然言語オートエンコーダ(NLA)を発表

出典 ─ Natural Language Autoe
Anthropic「SLEIGHT-Bench」、AI監視システムの死角を突く回避テキストのベンチマークを公開の記事画像
研究06.15読了5

Anthropic「SLEIGHT-Bench」、AI監視システムの死角を突く回避テキストのベンチマークを公開

出典 ─ SLEIGHT-Bench: Finding
Anthropic、安全訓練の汎化を検証する「Teaching Claude Why」を公開の記事画像
研究06.14読了5

Anthropic、安全訓練の汎化を検証する「Teaching Claude Why」を公開

出典 ─ Teaching Claude Why -
フィジカルAIとは──生成AIとの違いと、NVIDIAが日本で連呼した理由の記事画像
研究06.14読了8

フィジカルAIとは──生成AIとの違いと、NVIDIAが日本で連呼した理由

出典 ─ NVIDIA and Japan Bring
MoE(Mixture of Experts)とは──「総パラメータ」と「アクティブパラメータ」の読み分け方までの記事画像
研究06.12読了7

MoE(Mixture of Experts)とは──「総パラメータ」と「アクティブパラメータ」の読み分け方まで

出典 ─ Kimi K2 公式リポジトリ(Moonsh
AIエージェントとは──指示に答えるAIと、仕事を進めるAIの違いをわかりやすく整理するの記事画像
研究06.11読了14

AIエージェントとは──指示に答えるAIと、仕事を進めるAIの違いをわかりやすく整理する

出典 ─ Building Effective AI