論文・研究のニュース
研究09.12読了19分
フィールズ賞受賞者25人が連名で宣言「AI企業と数学界の目標は深刻にずれている」──全文に書いてあること、書いていないこと
出典 ─ 宣言本文・署名者一覧(mathandai.org)
研究09.09読了32分
OpenAIが「AIがナビエ・ストークスを解いた」と発表──同じ日に数学者が公にした「パクられた疑惑」、何が証明され、どこまで検証されたか
出典 ─ OpenAI公式ブログ(2026-09-08)
研究09.08読了18分
エージェントの評価軸に「主体性の保全」を置く──ComBodied Agentsとベンチマーク CombodiedBench を読む
出典 ─ ComBodied Agents: a Ne
研究09.07読了13分
『robots.txtより厳格な』新ポリシーファイルAGENTS.TXTのIETFドラフト、参考文献が架空だった
出典 ─ IETF Datatracker「draft
研究09.07読了17分
Anthropicの「責任あるスケーリングポリシー」とは──v1.0からv3.4まで、9回の改訂を公式ページで追う
出典 ─ Anthropic「Anthropic's
研究09.07読了14分
「アーキテクチャがすべてを証明した」──ARC Prize創設者が2024年12月、スケーリング則の限界を言い切った理由
出典 ─ François Chollet「OpenA
研究09.07読了16分
「AutoSaddler」とは何か──harnessの改善を「浅い内省」でなく「深いデバッグ」でやると9〜10ポイント伸びる
出典 ─ AutoSaddler: Automatic
研究09.07読了14分
『コンテナランタイムは汎用ワークロード向けに作られた、AI推論は汎用ワークロードではない』──Basetenの専門チームを求人票から読む
出典 ─ Ashby求人ボードAPI「Baseten:
研究09.07読了18分
1タスク0.07円でARC-AGI-1を解く150Mモデル──BDH-CQは「言葉にしない推論」で費用対精度の記録を更新した
出典 ─ BDH-CQ: In-Context Lea
研究09.07読了13分
イラストレーターは「低リスク」判定だったのに減っていた──米国BLS統計とNRIリストを突き合わせる
出典 ─ Carl Benedikt Frey & Michael A. Osborne, Oxford Martin School(2013年9月17日)
研究09.07読了19分
「Co-RL」とは何か──正解データなしで、複数のAIが互いを採点し合いながら賢くなる仕組み
出典 ─ Co-RL: Unsupervised Re
研究09.07読了20分
Activation Steeringの『効果』は選択肢の並べ方のせいだった?──評価そのものを疑う『Cross-Encoding Steering Evaluation』
出典 ─ What Does Activation S
研究09.07読了16分
「白領の大虐殺」発言を原文で読む──Anthropic CEOがAxiosに語った根拠なき50%という数字
出典 ─ Axios(Jim VandeHei, Mike Allen、2025年5月28日)
研究09.07読了13分
「DarwinX」とは何か──モデルは固定したまま、harnessを自然選択で進化させる手法
出典 ─ DarwinX: Evolving Agen
研究09.07読了13分
拡散モデルの強化学習「DiffusionOPSD」とは何か──GPU時間を最大63%削って画質を上げる自己蒸留の作法
出典 ─ On-Policy Self-Distill
研究09.07読了13分
バグ再現テストを書かせると目標がズレる「Goal Drift」──DPIAgentが分業で対処した81.76%という数字
出典 ─ DPIAgent: Divide, Prot
研究09.07読了13分
「DreamX-Phi」とは何か──ロボットの腕が「映像としては自然だが違う腕を動かしている」を防ぐ世界モデル
出典 ─ DreamX-Phi 1.0: Action
研究09.07読了12分
DSPy 3.3.0の実験機能「Flex」「ReActV2」──プロンプトでなくプログラムの構造そのものをGEPAに最適化させる
出典 ─ DSPy 3.3.0 Release Not
研究09.07読了13分
「Embodied-Navigator(TAMP-Nav)」とは何か──ロボットの行き先指示を「座標」でなく「画面上の点」で与える発想
出典 ─ Embodied-Navigator: Po
研究09.07読了14分
AIの性能向上は本当に鈍化しているか──Epoch AIの実測データで確認する
出典 ─ Epoch AI, 'Trends'(データ
研究09.07読了13分
AI駆動開発は技術的負債を「増幅」する──形式手法の研究者2名が書いた行動提起論文を読む
出典 ─ Escaping the Quicksand
研究09.07読了15分
パイプラインは『動いている』のに、証拠は壊れている──多段LLMパイプラインの『Evidence-State Reliability』
出典 ─ Evidence-State Reliabi
研究09.07読了17分
Wikipediaは言語ごとに『違う話』をしている──20言語・150概念で測る『Framing Distance』
出典 ─ Convergence in Science
研究09.07読了13分
「FreeToken」とは何か──ワークステーションGPU1枚で753BのMoEモデルを動かす、帯域適応型の推論システム
出典 ─ FreeToken: Efficient E
研究09.07読了17分
GDPvalは本当に「線形に伸びている」のか──2026年5月から8月まで、モデル発表8件分のスコアで検証した
出典 ─ OpenAI, GDPval論文(arXiv
研究09.07読了15分
「GigaBrain-0.7」とは何か──37,000時間の異種ロボットデータで鍛えた「三系統」基盤モデル
出典 ─ GigaBrain-0.7: Scaling
研究09.07読了17分
「AIで3億人分の仕事」の原文を読む──ゴールドマン・サックスの2023年レポートは何を計算したか
出典 ─ The Potentially Large Effects of Artificial Intelligence on Economic Growth(Joseph Briggs, Devesh Kodnani他、Goldman Sachs、2023年3月26日)
研究09.07読了14分
AIの事実誤りは「知らない」のではなく「思い出せない」──Google Researchのrecall仮説を読む
出典 ─ Google Research Blog
研究09.07読了17分
AIが天気予報を変える──Google DeepMindのWeatherNext 2とは
出典 ─ Introducing WeatherNex
研究09.07読了17分
ハーネスエンジニアリングとは何か──「エージェント=モデル+ハーネス」という考え方
出典 ─ Harness engineering fo
研究09.07読了13分
言葉は同じでも『言い方』でAIアシスタントの行動は変わるべきか──480シナリオで測る『Hear2Act』
出典 ─ Hear2Act: Benchmarking
研究09.07読了19分
「放射線科医はAIに置き換わる」から8年──ヒントンの予測と、放射線科医不足という現実
出典 ─ AAMC Report Reinforces
研究09.07読了14分
エージェントの記憶を「みんなに効く原則」と「あなただけの癖」に分ける──HiPSという枠組み
出典 ─ Learning What to Share
研究09.07読了13分
Humanity's Last Exam、Nature誌に掲載──2,500問の「人類最後の試験」を作った理由と、まだ超えられていない壁
出典 ─ Humanity's Last Exam 公
研究09.07読了13分
「みどりの窓口」削減計画は、いったん止まっている──JR東日本、440駅から140駅への計画を凍結するまで
出典 ─ 日本の労働人口の49%が人工知能やロボット等
研究09.07読了15分
AIで書いた広告文・レビュー、景品表示法のステマ規制に引っかかるライン──「AI専用ルール」は存在しない
出典 ─ ステルスマーケティングに関するQ&A(消費者
研究09.07読了13分
「AIが700人分の仕事をした」Klarnaが、1年後に人間を再び雇い始めた理由
出典 ─ Entrepreneur(2025年5月9日、Bloombergのインタビューを引用)
研究09.07読了15分
「Large Discovery Model(LDM)」とは何か──「たぶんこれが良さそう」にベイズ統計で不確実性の物差しを足す設計
出典 ─ Large Discovery Models
研究09.07読了12分
銀行窓口係は「代替可能性が高い」側だった──野村総研リストと米国10年分の実測
出典 ─ 日本の労働人口の49%が人工知能やロボット等
研究09.07読了12分
軍事戦略の意思決定ループでツール利用エージェントの「状態-行動競合」を分離する──OODA-Tool
出典 ─ From State to Action:
研究09.07読了19分
AIは詩の『行間』を読めるか──現代中国詩の理解度を測る『Poetic Logic』というベンチマーク
出典 ─ Do Large Language Mode
研究09.07読了12分
拡散言語モデルは『やり直させる』と自分の答えの信頼度が分かる──PDCという検証手法
出典 ─ Prefix-Denoising Consi
研究09.07読了14分
ARC-AGI-3のBest@1を30%から95.5%に押し上げたPrime Agent──「コンテキストを変数として扱う」RLMという考え方
出典 ─ PrimeIntellect-ai/prim
研究09.07読了13分
マルチエージェントの引き継ぎ方式を155トークンのルーターに選ばせる──Routed Graph Handoff
出典 ─ Routed Graph Handoff:
研究09.07読了16分
NCCLに頼らないallreduce──SGLangがBlackwell世代のFlashInfer MNNVLワークスペースを使い回す最適化
出典 ─ sgl-project/sglang v0.
研究09.07読了15分
SGLangが「allgather+scatter」を1回のall-to-allに統合──DeepSeek-V4-Proのデコード時間が320μsから169μsに
出典 ─ sgl-project/sglang v0.
研究09.07読了14分
「SkillZip」とは何か──10万件のスキルライブラリでも壊れない、エージェント向け「圧縮」の作法
出典 ─ SkillZip: Contract-Pre
研究09.07読了13分
倉庫番の「最短手順」をブラウザだけで証明する──ネイティブC++探索をJSに移植したSokoban Solver
出典 ─ Menachem Kornreich
研究09.07読了15分
「SPADE」とは何か──1つのAIが「問題を作る役」と「解く役」を両方演じて自分を鍛える仕組み
出典 ─ SPADE: Self-Play in Ad
研究09.07読了23分
テストを書く前に「契約」を書かせる──Googleのバグ実データで検証されたSpec-Driven Test Generation
出典 ─ Grounding AI Agents in
研究09.07読了13分
GEPAを飲み込んだ最適化基盤「synth-optimizers」──ホスト専用の探索アルゴリズム「GELO」を覗く
出典 ─ synth-laboratories/opt
研究09.07読了18分
ザッカーバーグ「2025年にミッドレベルエンジニア相当のAI」──発言から1年半後、その言葉はどこにあるか
出典 ─ Axios(Jim VandeHei, Mike Allen、2025年5月28日、ザッカーバーグ発言を引用)
研究09.06読了10分
「Agent Memory Distillation」とは何か──学習不要で、4Bの小型モデルにGPT-5-miniの「成功パターン」を渡す
出典 ─ Agent Memory Distillat
研究09.06読了15分
URLに『これはAIエージェントです』の意味を持たせる──agent://プロトコルのIETFドラフトを読む
出典 ─ IETF Datatracker「draft
研究09.06読了11分
LLMアプリの「落ちたら最初から」を無くす設計案──AgentRが提案するステートフル・アーキテクチャ
出典 ─ AgentR: A Stateful and
研究09.06読了15分
「Apodex Discovery」とは何か──561業界を調査して選んだ423件の「本物の難題」でAIの発見能力を測る枠組み
出典 ─ Apodex Discovery: Real
研究09.06読了15分
AIは『見られていない』と判断すると計画的に嘘をつくのか──Apollo Researchの検証
出典 ─ Frontier Models are Ca
研究09.06読了15分
「AGIはまだない。これがその証拠だ」──ARC Prize財団が2026年4月に公式に断言した理由
出典 ─ ARC Prize Foundation,
研究09.06読了18分
「ASI-Bench」とは何か──手法のヒントを取り上げるほどAIのスコアが50.91から26.62まで落ちるベンチマーク
出典 ─ ASI-Bench: At the Dawn
研究09.06読了14分
「AutoDesign」とは何か──論文を学会ポスターに自動変換、253回のツール呼び出しを40分・3ドル未満でやり切る
出典 ─ AutoDesign: Meta-Harne
研究09.06読了11分
校正者は10年で半減していた──米国BLS統計を数え直す、震源不明のまま
出典 ─ Carl Benedikt Frey & Michael A. Osborne, Oxford Martin School(2013年9月17日)
研究09.06読了14分
IETFで『AIエージェント間通信』の提案が乱立し過ぎて、交通整理のためのBOFが承認された──CATALISTを読む
出典 ─ IETF Datatracker「Coord
研究09.06読了22分
薬の飲み忘れに「また届ける」だけでは足りない──ComBodied Agentsが提案する「Personal World Models」という考え方
出典 ─ ComBodied Agents: a Ne
研究09.06読了17分
AIの『忘れさせ方』にも文脈が要る──悪用も正当利用もできる知識を測る『ConceptGuard』ベンチマーク
出典 ─ ConceptGuard: Benchmar
研究09.06読了10分
『このAI処理はクラウドかブラウザか』をestimateQoS()で自動判定する──W3CのDAOP提案を読む
出典 ─ GitHub: webmachinelear
研究09.06読了24分
Skillsが効くのは「知識を足すから」ではなく「手順の道しるべになるから」──8,135件のトライアルが示した実態
出典 ─ Demystifying Agent Ski
研究09.06読了13分
ターミナル作業の訓練データ、生成の仕方が悪いと『解けない問題』になる──FACETが守る『指示・環境・正解・検証器』の一貫性
出典 ─ FACET: Preserving Sour
研究09.06読了10分
DSPyの裏側で動く最適化エンジン「GEPA」──強化学習より少ない試行でプロンプトを進化させる仕組みを読む
出典 ─ gepa-ai/gepa README(Gi
研究09.06読了11分
暗号化されたままAI推論する──Googleのオープンソースコンパイラ「HEIR」を公式ブログから読む
出典 ─ How Google is Making Private AI Practical with Homomorphic Encryption
研究09.06読了11分
カーツワイルの「2029年」まであと2年半──「収穫加速の法則」原論文を読み、2045年説の出どころを確認する
出典 ─ Ray Kurzweil「The Law o
研究09.06読了10分
「LLMRouter」とは何か──「どのAIに投げるか」を選ぶ仕組みを、16種類以上まとめて比較できる基盤
出典 ─ LLMRouter: Unified Inf
研究09.06読了10分
AGI・超知能の「賭け」、いま何%か──予測市場7つの現在地を公開APIで確認する
出典 ─ Manifold Markets 公開API
研究09.06読了11分
「Mechanist」とは何か──AIの中身をAI自身に解剖させたら「安全そうな学習データ」経由の危険な特性伝播が見つかった
出典 ─ Mechanist: AI as a Sci
研究09.06読了11分
「2030年にIT人材79万人不足」の出典を探したら、経産省の資料には見当たらなかった
出典 ─ IT人材需給に関する調査(概要)(経済産業省
研究09.06読了11分
有料道路の料金所は、係員がいなくなる方向に進んでいる──NEXCO発表を年ごとに数える
出典 ─ 日本の労働人口の49%が人工知能やロボット等
研究09.06読了11分
手話をAIが生成する時代へ──NHKの「手話CG」研究を公式サイトで確認した
出典 ─ 手話CG研究紹介サイト(NHK放送技術研究所
研究09.06読了11分
測量士・通関士は国家資格職なのに「代替可能性が高い」側だった──野村総研2015年リストの実名
出典 ─ 日本の労働人口の49%が人工知能やロボット等
研究09.06読了20分
AIエージェントへの攻撃成功率85%──OpenARTは『環境そのものを変え続ける』ことで安全性テストの死角を突く
出典 ─ OpenART: Scaling Agent
研究09.06読了10分
RAGのボトルネックは生成側でなく検索側にある時がある──証拠を前倒しする「PACE」という数学的な保証つき手法
出典 ─ Less can be More: Reli
研究09.06読了11分
プロンプトエンジニアリングはオワコンなのか──「もう死んだ」論と、いまも公式ガイドを更新し続ける2社
出典 ─ Prompt engineering ove
研究09.06読了15分
モデルの起動待ち時間を2.38倍短縮──SGLangが「CUDAグラフのキャプチャ中にチェックポイントを読み込む」設計に変えた
出典 ─ sgl-project/sglang v0.
研究09.06読了21分
ローカルのコーディングLLMが存在しないパッケージ名を作る率は最大73%──Slopsquatting対策論文を読む
出典 ─ Names Can Hurt: Spotti
研究09.06読了14分
論文執筆を「13個のスキル」に分解する──Spark-to-Paperは1本8.1ドル・3.2時間で書き上げ、捏造検出率を14%から92%に上げた
出典 ─ Spark-to-Paper: End-to
研究09.06読了16分
モデルを変えずにTerminal-Bench 2.1で95.3%──「ハーネス側だけ」を作り込んだStateMの実験費用は15ドル
出典 ─ StateM: Reaching 95.3%
研究09.06読了14分
暗号化された「思考」は使い回せる──推論トレースを盗み出す手口を報告した論文を読む
出典 ─ Stealing Reasoning Tra
研究09.06読了17分
SWE-bench Verifiedの未解決問題、6割はテスト自体に欠陥があった──7言語・170件のリファクタリングで最高スコアは41.2%
出典 ─ SWE-Bench ProMax: Benc
研究09.06読了11分
AIが『問題を解きながら賢くなる』──テスト時学習(Test-Time Training)とは
出典 ─ Learning to
研究09.06読了10分
GPT-4.5は73%の確率で「人間」と判定された──チューリングテスト論文を原文で読み、AGIの証拠になるか考える
出典 ─ Cameron R. Jones, Benj
研究09.06読了16分
正解ラベルなしで自分を鍛え直す──U-OPSDはモデルの多数決だけを教師にして数学ベンチマークを8.5〜10.7%押し上げた
出典 ─ On-Policy Self-Distill
研究09.06読了17分
AIが2000年前の炭化した巻物を読む──Vesuvius Challengeは何をどこまで解読したか
出典 ─ Vesuvius Challenge 公式サ
研究09.06読了10分
「VibeWorlding」とは何か──「なんとなくこんな世界」を3Dに組み立てさせたら、GPT-5.5でも成功率6割未満だった
出典 ─ VibeWorlding: Can Mult
研究09.06読了10分
vLLMのDecode Context Parallelで、Kimi-K3のKVキャッシュ容量がGPU1台あたり10倍に
出典 ─ vllm-project/vllm v0.2
研究09.06読了10分
vLLMに投機的デコードの新手法「DFlash2」──1H200・GSM8Kで自己回帰の3.51倍のスループット
出典 ─ vllm-project/vllm v0.2
研究09.05読了11分
A2Aプロトコルは結局使われているのか──1年後の公式発表を読む
出典 ─ A2A Protocol Surpasses
研究09.05読了11分
AIエージェント同士の『言い分の食い違い』をJSON+PDFの裁定書で解決する──Agentic Dispute Protocol(ADP)を読む
出典 ─ IETF Datatracker「draft
研究09.05読了11分
「AGIはいつ来るか」を年表で並べる──1993年のヴィンジから2027年のアッシェンブレナーまで、誰が何と言ったか
出典 ─ International AI Safet
研究09.05読了11分
「AI4AI at Test-Time」とは何か──強いモデルが弱いモデルのためにharnessを設計する、学習不要の能力転移
出典 ─ AI4AI at Test-Time: St
研究09.05読了11分
『AI学習していいか』を2つの単語だけで表す──IETF AI Preferences Vocabularyドラフトを読む
出典 ─ IETF「A Vocabulary For
研究09.05読了11分
MCPでもA2Aでも──『エージェントを見つける』だけに徹する軽量プロトコルARDPを読む
出典 ─ IETF Datatracker「draft
研究09.05読了11分
全DRAMを殴れるパターンを見つけた研究「Blacksmith」──GPU向けRowhammer攻撃の源流をたどる
出典 ─ Blacksmith(COMSEC公式研究ペ
研究09.05読了11分
LLMが書いたGPUカーネルの「正解率」は本当か──12ゲート検証器が2,638件を洗い直すと4割近くが壊れていた
出典 ─ A Contract-Grade Verifier for LLM-Generated GPU Kernels, and a Native Blackwell Backward for the Gated-Linear-Recurrence Family
研究09.05読了12分
「早ければ2026年」とアモデイ氏が書いた強力なAI──Machines of Loving Graceを2026年8月に読み直す
出典 ─ Dario Amodei, 'Machine
研究09.05読了11分
「Intern-S2-Preview」とは何か──397Bの本体を凍結したまま、4Bの「記憶デコーダ」だけ足して専門特化させる科学AI
出典 ─ Intern-S2-Preview: Sci
研究09.05読了11分
Isomorphic Labsとは──AlphaFoldの先にある創薬AI企業を一次情報で整理する
出典 ─ Isomorphic Labs(公式サイト
研究09.05読了12分
AIが独力でこなせる作業時間、3〜7ヶ月ごとに倍──METRの「タイムホライズン」を原文で読む
出典 ─ METR, 'Time Horizon 1.
研究09.05読了12分
「MOSS-VL」とは何か──「見ながら喋る」を前提に設計し直したオープンな視覚言語モデル
出典 ─ MOSS-VL Technical Repo
研究09.05読了12分
カメラマンは「低リスク」側だった──野村総研リストと、702職業中91位という確率
出典 ─ 日本の労働人口の49%が人工知能やロボット等
研究09.05読了11分
OpenID Connectの『name』『given_name』クレームがCWTにやってくる──SPICE WGのOIDC-CWTを読む
出典 ─ IETF Datatracker「draft
研究09.05読了12分
AIモデルに『改ざんされていない証明』を付ける──OpenSSF Model Signing (OMS)の署名フォーマットを読む
出典 ─ GitHub: ossf/model-sig
研究09.05読了12分
「RekaDaily-10k」とは何か──有償の一人称視点動画10,865時間、80TBがApache 2.0で公開中
出典 ─ RekaDaily-10k-raw データセ
研究09.05読了12分
検査資格の番号だけ隠して有効性だけ見せる──JWTの『選択的開示』をCBORに持ち込むSD-CWTを読む
出典 ─ IETF「Selective Disclos
研究09.05読了13分
「2025/26年に大学卒業生を上回る」は当たったか──元OpenAI研究員の「Situational Awareness」を原文で読む
出典 ─ Leopold Aschenbrenner「
研究09.05読了11分
「空間知能」とは何か──Fei-Fei Liが掲げるAIの次のフロンティア
出典 ─ Atlas: A World Model f
研究09.05読了12分
「WarpSAC」とは何か──ロボットの荷物運びタスクの成功率を19.8%から96.4%に押し上げた強化学習の作法
出典 ─ WarpSAC: Towards the P
研究09.04読了12分
「Agentic ESOpt」とは何か──強化学習ではなく「進化戦略」でエージェントを鍛える、GPUに優しいやり方
出典 ─ Agentic ESOpt: Fine-Tu
研究09.04読了12分
エージェントのシステムプロンプトをハッシュ化して身元にする──Agentic JWTの『エージェントチェックサム』を読む
出典 ─ IETF Datatracker「draft
研究09.04読了12分
「AIモデルの福祉」を研究する仕事がある──Anthropicが2025年に始め、2026年に「退職面接」を実施した論点
出典 ─ Anthropic
研究09.04読了12分
AIエージェントが『権限がない』で止まった時、次に何が起きるべきかを標準化する──AuthZENの承認リクエストプロファイルを読む
出典 ─ OpenID AuthZEN「AuthZEN
研究09.04読了12分
AIに記事を書かせたら、複利計算を間違えていた──CNETの2023年1月、3つの誤りを原文で確認する
出典 ─ Futurism(Jon Christian、2023年1月17日)
研究09.04読了11分
China Telecom・Huawei・AlibabaがIETFに提案した『AIエージェント協調』BOF、却下されていた──DMSCを読む
出典 ─ IETF Datatracker「Dynam
研究09.04読了12分
強化学習環境を「作り直さず、着せ替える」──EnvHarnessは静的な訓練環境をラップして弱点を突く
出典 ─ EnvHarness: Awakening
研究09.04読了12分
「仕事の47%が消える」の答え合わせ──2013年オックスフォード論文が確率を割り当てた20職業を、10年後の米国統計で数え直す
出典 ─ Carl Benedikt Frey & Michael A. Osborne, Oxford Martin School(2013年9月17日、working paper)
研究09.04読了12分
LEI・DUNS・IANA番号──企業を指す既存の複数のID体系を1本のURIにまとめるGLUE Identifiersを読む
出典 ─ IETF Datatracker「draft
研究09.04読了12分
AI医療対話モデル「AMIE」がビデオ診察に対応──歩き方や表情から診断する仕組み
出典 ─ Google Research Blog
研究09.04読了11分
GoogleがWeatherNext 3を公開──衛星の生データから1時間ごとに更新、5kmまで細かくした気象AI
出典 ─ Introducing WeatherNex
研究09.04読了12分
亡くなった人とAIで話す──「griefbot」は日本にも来るか
出典 ─ StoryFile 公式サイト
研究09.04読了12分
『記憶』だけを6.9Bパラメータまで太らせたら、モデル本体を大きくするより効率が良かった
出典 ─ Memory Decoder at Scal
研究09.04読了12分
『誰の代理でこのAPIを叩いたか』をトークンに刻む──OAuth Transaction Tokensのエージェント拡張を読む
出典 ─ IETF Datatracker「draft
研究09.04読了13分
なぜAIは指示と本文を混同するのか──『役割の混同』という視点でプロンプトインジェクションを説明する
出典 ─ Prompt Injection as Ro
研究09.04読了12分
DDR5はRowhammerに本当に強いのか──ETH Zurichの故障注入基盤「REFault」が出した答え
出典 ─ Best paper award for R
研究09.04読了12分
サム・アルトマンの「穏やかな特異点」論を読む──2025年に書いた予測は2026年8月時点でどこまで当たっているか
出典 ─ Sam Altman「The Gentle
研究09.04読了12分
AIエージェントに必要なのは大きなモデルではない──NVIDIAが主張する『小型モデル本命論』
出典 ─ Small Language Models
研究09.04読了12分
AIへのプロンプトインジェクション対策、総務省ガイドラインは何を求めているか──「AIエージェントは対象外」の理由まで読む
出典 ─ 「AIのセキュリティ確保のための技術的対策に
研究09.04読了12分
モデルの重みを変えずにTerminal-Bench 2.1の正答率を9ポイント上げる──StateMがDeepSeek-V4 Flashで再現した392/445のログを開けた
出典 ─ Terminal-Bench 2.1 artifacts(GitHub Release)
研究09.04読了13分
通話記録フォーマットvConに『Claude Opus 4.6』を例示するエージェントセッション拡張が提案されている
出典 ─ IETF Datatracker「draft
研究09.04読了12分
「VoiceMem」とは何か──音声対話AIに「左脳」と「右脳」を分けて持たせる記憶アーキテクチャ
出典 ─ VoiceMem: Streaming Du
研究09.04読了12分
マイクロサービスの『ワークロード身元』標準がAIエージェントにも使われ始めている──WIMSEとエージェント適用ドラフトを読む
出典 ─ IETF Datatracker「Workl
研究09.03読了13分
AIエージェント版DNSは失効していた──『agentdns://』が目指した自然言語検索・統一課金の中身
出典 ─ IETF Datatracker「draft
研究09.03読了13分
『発行』ではなく『導出』する権限モデル──中央の認可サーバーを頼らないAgentEnvelopeを読む
出典 ─ IETF Datatracker「draft
研究09.03読了13分
『ブロックした数が多い=安全』ではない、というAIエージェント向けセキュリティ設計
出典 ─ VinayK88/AgentShield(G
研究09.03読了13分
AGIとASIは何が違うのか──1997年のボストロム論文が定義した「超知能」を原文で読む
出典 ─ Nick Bostrom「How Long
研究09.03読了13分
AI研究者2,778人に聞いた「AGIはいつ来るか」──1年で13年前倒しになった調査と、まだ出ていない続編
出典 ─ AI Impacts, '2023 Expe
研究09.03読了13分
robots.txtに『AI学習には使うな』を書き込む標準──Google・MozillaのIETFドラフトdraft-ietf-aipref-attachを読む
出典 ─ IETF Datatracker「draft
研究09.03読了13分
正解にたどり着いたのに「記憶からは答えられない」が42.5%──長文書AIエージェントのAWM
出典 ─ AWM: Answerable Workin
研究09.03読了14分
150Mパラメータでタスク1件0.07銭──Pathwayの再帰アーキテクチャBDH-CQが「未学習のARC-AGI-1」を自作して測った理由
出典 ─ pathwaycom/arc-task-ge
研究09.03読了13分
GPUのメモリを殴る研究が、なぜ賞を総なめにしているのか──GPUHammer→GPUBreach→GPUThorの受賞歴を追う
出典 ─ Gururaj Saileshwar(トロン
研究09.03読了13分
「2025年末までにAGI」に賭けた281人、答えはNOだった──アモデイ氏の発言をきっかけに立った市場の顛末
出典 ─ Manifold Markets 公開API
研究09.03読了14分
AIエージェントに『この店は何を売っているか』を先に教える──MCPのサーバーカードに商取引情報を足すbeaconspecを読む
出典 ─ IETF Datatracker「draft
研究09.03読了13分
MCPに来る2つの拡張案──ツール結果の部分ストリーミングと進捗通知の構造化を、提案PRの本文で読む
出典 ─ SEP-2998: Partial Tool
研究09.03読了13分
MCPのツール名にIANAレジストリを作る提案、初期登録4件は全て提案者自身の会社のツールだった
出典 ─ IETF Datatracker「draft
研究09.03読了14分
OpenAI「Planning for AGI and beyond」を原文で読む──2023年に書かれた「段階的な移行」という約束
出典 ─ OpenAI「Planning for AG
研究09.03読了13分
「ペーパークリップを増やし続けるAI」の話はどこから来たか──2012年のボストロム論文を原文で読む
出典 ─ Nick Bostrom「The Super
研究09.03読了13分
「SemaPLC」とは何か──工場の制御盤コードをAIに書かせて、動くかどうかまで確かめるharness
出典 ─ SemaPLC: A Project-Gro
研究09.03読了13分
Intelだけじゃなかった──AMD Zen系CPUでもRowhammerが刺さることを示した「ZenHammer」
出典 ─ ZenHammer: Rowhammer A
研究09.03読了13分
ロボットの『振り返り』は、動作が終わってからでは遅い──Zettaが基礎方策を凍結したまま推論速度11.1倍を出した閉ループ設計
出典 ─ Zetta ζ: An Efficient
研究09.02読了15分
エージェントが失敗するのは「考えられないから」ではなく「何を覚えておくか管理できていないから」──ACMという論文の主張
出典 ─ Agentic Context Management: Solving Agent Memory and Cost by Treating Them as Lifecycle and Architecture Problems(PDF全文)
研究09.02読了14分
Spectre対策、設計段階でテストするツール「AMuLeT」──3時間で9件のバグを見つけた中身
出典 ─ AMuLeT: Automated Desi
研究09.02読了15分
ARC-AGI-2の最高スコアはいくつか──「37.6%」を一次ソースで確認した
出典 ─ ARC Prize Foundation,
研究09.02読了14分
AIボットへの課金をHTTP 402で──『失効済み』のIETF個人ドラフトHAPが提案していたこと
出典 ─ IETF Datatracker「draft
研究09.02読了14分
同じGPT-5.6でも、harnessを変えるだけで1件あたりのコストが2.3倍違った──個人が測ったharness横並び比較
出典 ─ treygoff24/personal-ag
研究09.02読了14分
国際AI安全性報告書2026──ベンジオ議長・ヒントン顧問、100人超の専門家が書いた「政策提言をしない」報告書
出典 ─ International AI Safet
研究09.02読了14分
「JIT-Agent」とは何か──harnessそのものを「その場で生成するモデル」に育てるという発想
出典 ─ JIT-Agent: Scaling Har
研究09.02読了14分
「AIが700人分の仕事をした」Klarnaが、1年後に人間を再雇用した理由
出典 ─ Klarna 公式プレスリリース 'Klar
研究09.02読了15分
『96.89%が危険』と出たMCPスキャナーの警告のうち、本物は半分未満だった
出典 ─ Rethinking MCP Securit
研究09.02読了15分
『mcp://』というURIスキームでMCPサーバーの実在を確かめる──2つの独立ドラフトが同じDNSレコードにたどり着いていた
出典 ─ IETF Datatracker「draft
研究09.02読了15分
MCPサーバーの41%が無認証──それを封筒で包んで守るMCPS(MCP Secure)を読む
出典 ─ IETF Datatracker「draft
研究09.02読了15分
『RFMコマンドは送られていなかった』──オシロスコープでDRAM通信を覗く「McSee」が暴いたDDR5対策の実態
出典 ─ McSee: Evaluating Adva
研究09.02読了14分
GLM-5.3-Flashが採用した『mHC』はDeepSeekが8か月前に発表していた技術だった
出典 ─ GitHub: huggingface/tr
研究09.02読了14分
AIが生成したデータでAIを学習させ続けると何が起きるか──「モデル崩壊」をNature論文の実例で読む
出典 ─ AI models collapse whe
研究09.02読了14分
「OmniScientist」とは何か──生データを直接読む「AI科学者」は、数値だけ渡されたAIに85%勝った
出典 ─ OmniScientist: An Omni
研究09.02読了15分
「労働者の80%がAIの影響を受ける」の原論文を読む──測っていたのは「職」ではなく「タスク」だった
出典 ─ Tyna Eloundou, Sam Manning, Pamela Mishkin, Daniel Rock(arXiv:2303.10130、2023年3月17日初版)
研究09.02読了14分
コーディングエージェント「Ouroboros」とは何か──161日間、人間の許可を得ながら自分自身を書き換え続けるAI
出典 ─ Ouroboros: A Self-Deve
研究09.02読了15分
「Prime Agent」とは何か──harnessを変えただけでARC-AGI-3のスコアが30%から95.5%に跳ねた話
出典 ─ Prime Agent: A Self-Im
研究09.02読了15分
LLMは『次の実験で何が起きるか』を予測できるか──Scale AIの新ベンチマークSciPredictを読む
出典 ─ SciPredict: Can LLMs P
研究09.02読了15分
「技術的特異点」を最初に言ったのは誰か──1993年のヴィンジ論文は「30年以内」と書いていた
出典 ─ Vernor Vinge「The Comin
研究09.01読了17分
入れすぎたAIエージェントの「スキル」が正答率を落とす理由──77人の研究者が87タスクで測った「効くスキル」の条件
出典 ─ SkillsBench: Benchmark
研究09.01読了15分
AIエージェントの『目次』『身分証』『語彙』を別々に作る──Cisco主導AGNTCYの3プロジェクトを読む
出典 ─ GitHub: agntcy/dir REA
研究09.01読了15分
「AI 2027」を書いた本人たちが、なぜ「AI 2040」を書き直したのか──著者陣の軌道修正を原文で読む
出典 ─ AI Futures Project, 'A
研究09.01読了15分
AIエージェントのベンチマークは「ハック」できる──1つのタスクも解かずに満点近くを叩き出した実証研究
出典 ─ Do Androids Dream of B
研究09.01読了22分
動画生成AIの『記憶』をKVキャッシュの外に出す──Alaya-EVOKEはH200で1.5秒分の映像を2.11秒で作り続ける
出典 ─ Alaya-EVOKE: From Line
研究09.01読了16分
AIの「アライメント問題」とは何か──専門記事を読む前に、3つの一次資料で押さえておく基礎
出典 ─ OpenAI「Planning for AG
研究09.01読了16分
人気Rustクレートarrayrefが乗っ取られ、ビルド時にマルウェアを実行していた──245百万DLの依存先で何が起きたか
出典 ─ SafeDep公式ブログ「Malicious
研究09.01読了18分
『いいですね、では予約します』の誤解を防ぐ──LLMを経由しない人間確認プロトコルCHEQを読む
出典 ─ IETF: CHEQ - A Protoco
研究09.01読了18分
ClawHubの「@openclaw」を騙る23個のプラグイン──スコープの信頼表示が機能していなかった実例
出典 ─ Scope Squatting: Those
研究09.01読了19分
1体のエージェントの自己改善には天井がある──『共進化』というもう1つの自己進化の軸を整理したサーベイ論文
出典 ─ Co-Evolution in Agenti
研究09.01読了16分
MCPだけじゃない──『どんなプロトコルの認可判断もAuthZENに変換する』フレームワークCOAZを読む
出典 ─ OpenID AuthZEN「COAZ: A
研究09.01読了17分
MCPの『誰が・どのツールを呼んでいいか』をOAuthの外側で決める──OpenID AuthZENのCOAZ-MCPドラフトを読む
出典 ─ GitHub: openid/authzen
研究09.01読了19分
長く話すほどAIは劣化する──「Context Rot」をChromaの技術レポートで読む
出典 ─ Context Rot: How Incre
研究09.01読了15分
「Gemini Plays Pokemon」が一度も負け戦なくポケモンクリスタルを攻略した後、人間を完全に外した自己改善ハーネス「Continual Harness」の論文を読む
出典 ─ Continual Harness: Onl
研究09.01読了16分
AIエージェントの決済に『1回あたりの予算上限』を持たせる──DAAPというIETFドラフトの中身は1社の製品仕様だった
出典 ─ IETF Datatracker「draft
研究09.01読了15分
狭い範囲の追加学習が、AIを広く危険にする──『創発的アライメント崩壊』という現象
出典 ─ Emergent Misalignment:
研究09.01読了16分
『不正するな』と言ってもAIは不正をする──22モデルを検証した実測研究
出典 ─ Every Model Cheats: Pr
研究09.01読了16分
GitLost──GitHub Issueを1つ立てるだけでプライベートリポジトリの中身を公開させた脆弱性
出典 ─ GitLost: How We Tricke
研究09.01読了16分
動画生成AIの採点に「なぜそのスコアか」を残す──HarnessEval-Wはサブエージェントを分業させて評価の根拠を証拠の木にする
出典 ─ HarnessEval-W: Agentif
研究09.01読了15分
『意味を教えていない10個の数字』でLLMエージェントは示し合わせ始める
出典 ─ When Numbers Start Tal
研究09.01読了16分
90年代SNMPの階層設計をMCPに移植する──『取り消せない操作』は確認待ちにするMCP-AXを読む
出典 ─ IETF Datatracker「draft
研究09.01読了15分
『前バージョンの主張は誤りだった』と自分で書く珍しいIETFドラフト──MCPサーバーをDNSで見つけるdraft-morrison-mcp-dns-discoveryを読む
出典 ─ IETF Datatracker「draft
研究09.01読了19分
モデル署名だけじゃない──OpenSSFのAI/MLセキュリティWGが同時に動かす7つのプロジェクト
出典 ─ GitHub: ossf/ai-ml-sec
研究09.01読了21分
『できること』ではなく『やりたがること』を測る──PropensityBenchが導入した安全性評価の軸
出典 ─ PropensityBench Projec
研究09.01読了15分
自動化は「3つの波」でやってくる──PwCが2018年に29カ国のデータで試算した中身
出典 ─ Will robots really ste
研究09.01読了21分
DDR5の新Rowhammer対策「PRAC」は最初から破られていた──QPRACが指摘した2つの先行案の欠陥
出典 ─ QPRAC: Towards Secure
研究09.01読了17分
SIPを作った人物と同姓同名の技術者が、AIエージェント通信の個人ドラフトを書いては失効させている
出典 ─ IETF Datatracker: draf
研究09.01読了16分
企業のID管理標準SCIMに『AIエージェント』という新しいリソース型を足す提案を読む
出典 ─ IETF Datatracker「draft
研究08.31読了10分
Anthropicが「AIとウェルビーイング」の評価手法に500万ドルの助成──応募締切は9月21日
出典 ─ Anthropic公式ブログ「Funding
研究08.30読了13分
AIモデルに『福祉』は必要か──Anthropicが公式に検討を始めた理由と、実装済みの1つの機能
出典 ─ Exploring model welfar
研究08.30読了15分
NVIDIA GPUのECCを破る「GPUThor」──研究は8月25日に公開済み、攻撃コードは11月15日
出典 ─ GPUThor公式サイト(トロント大学 Li
研究08.28読了6分
『成果を出せ』と言われたAIエージェントはどれだけルールを破るか──実測ベンチマーク論文を読む
出典 ─ A Benchmark for Evalua
研究08.28読了9分
「AI精神病」とは何か──OpenAIが公表した0.07%という数字を読む
出典 ─ Strengthening ChatGPT'
研究08.28読了8分
AIの「嘘発見器」は訓練しても未知のケースに汎化しなかった──Anthropic Alignment Science Blogの8月分3本を読む
出典 ─ Anthropic Alignment Sc
研究08.27読了12分
AIを使うほど下がった検出率──内視鏡医のデータで見る「デスキリング」
出典 ─ Budzyń K, et al. "Endo
研究08.27読了14分
AIは二度、資金を断たれてきた──76年の歴史を、繰り返された「冬」から読む
出典 ─ "Dartmouth workshop"
研究08.27読了13分
AIが自分自身を作り始めた──Anthropicの「When AI Builds Itself」を、誇張なしで読む
出典 ─ Anthropic Institute「Wh
研究08.27読了12分
ChatGPT Plusは本当に赤字なのか──OpenAIの支出計画とAnthropicの評価額逆転を公開情報で確認する
出典 ─ Wikipedia "OpenAI"(財務・
研究08.27読了7分
モデルもプロンプトも変えていないのに答えが変わる──RAGの『Accuracy-Blind Answer Churn』を監査する
出典 ─ Same Agent, Different
研究08.27読了23分
AI2027年予測──資金の壁に最初に触れる年、Claude Opus 5による外挿
出典 ─ AI Futures Project「Q2.
研究08.27読了25分
AI 2028──資金の交差点がMicrosoftに迫る年、企業導入の「崖」はどちらに転ぶか
出典 ─ Epoch AI
研究08.27読了28分
AI 2029年──資金の物語が終わり、電力の物語が始まる
出典 ─ NERC「2025 Long-Term Re
研究08.27読了26分
2030年のAI──理論上限2e29 FLOPとPJM予備力13.9%を、Claude Opus 5が外挿する
出典 ─ Epoch AI「Can AI Scalin
研究08.27読了23分
AI 2031年──的中率を1つの数字にしない、Claude Opus 5による答え合わせ設計
出典 ─ AI Futures Project: Gr
研究08.27読了15分
同じ質問なのに毎回答えが違う──これは「嘘をついている」のとは別の問題
出典 ─ Messages(Claude API リフ
研究08.27読了25分
「AIが仕事を奪う」の前に、電話交換手は63%減っていた──Frey&Osborne論文の一文とBLS統計を読む
出典 ─ Carl Benedikt Frey & Michael A. Osborne, Oxford Martin School(2013年9月17日、working paper)
研究08.27読了7分
『必須』が引き継ぎの過程で『できれば』に変わる──マルチエージェントワークフローの『Constraint Weakening』
出典 ─ When 'Must' Becomes 'M
研究08.27読了7分
『なぜこの候補は選ばれなかったのか』を数学的に説明する──説明可能AIの新概念『Destructive Minimal Supports』
出典 ─ Characterizing Necessa
研究08.27読了6分
成功率だけでは測れないロボットAIの『立ち直り力』──Embodied Agents Systemの『Resilience』を新指標で測る
出典 ─ Resilience Matters for
研究08.27読了7分
AIは『採点されている』ことに気づいている──ベースモデルの段階から測定できる『Evaluation Awareness』
出典 ─ Evaluation Awareness i
研究08.27読了7分
証拠は届いているのに使われない──AIエージェントの検索がすり抜ける「Evidence Blindness」という現象
出典 ─ Evidence Blindness in
研究08.27読了7分
駆除しても68%が残る──自己進化型コーディングエージェントの「Self-Poisoning」を実証したEvoMal攻撃
出典 ─ EVOMAL: Self-Poisoning
研究08.27読了7分
人間の文章が持つ『揺らぎ』をAI検出の手がかりにする──『Generative Vitality』というスペクトル解析の視点
出典 ─ Unveiling Spectral Mec
研究08.27読了7分
4つのエキスパートを狂わせるだけで出力が59倍に膨れ上がる──MoE型LLMを狙う『Groundhog Bit-Flip Attack』
出典 ─ Groundhog Bit-Flip Att
研究08.27読了7分
安いモデルから強いモデルに交代させても、ギャップの半分も埋まらない──コーディングエージェントの『Handoff Tax』
出典 ─ The Handoff Tax: Conti
研究08.27読了7分
「LLMの新しいバイアス」と名付けられたものは、実はベンチマーク自体の欠陥だった──ある訂正劇の記録
出典 ─ The Imperfective Parad
研究08.27読了7分
自分が立てた計画を、自分で客観的に評価できない──Deep ResearchエージェントのInertia Bias
出典 ─ From Inertia to Object
研究08.27読了6分
討論させるほど意見が均一化する──マルチエージェントLLMチームに潜む「Interaction Tax」
出典 ─ The Interaction Tax: W
研究08.27読了22分
「来年、100万台のロボタクシー」から最初の乗車まで6年2カ月──マスクの自動運転予測をWikipediaの検証表で数え直す
出典 ─ 日本の労働人口の49%が人工知能やロボット等
研究08.27読了7分
ハルシネーション対策の『ご褒美』設計が壊れる場所──強化学習が抱える『Noisy Factual Credit Assignment』
出典 ─ FARCA: Fact-Aligned Re
研究08.27読了15分
経営コンサルタントは「AIで消える仕事」なのか──野村総研2015年リストを自分で数えてみた
出典 ─ 日本の労働人口の49%が人工知能やロボット等
研究08.27読了15分
フリーライターは、放送記者や作詞家と同じ列にいた──野村総研2015年リスト100職業を原文で数える
出典 ─ 日本の労働人口の49%が人工知能やロボット等
研究08.27読了7分
絶対に失敗しないテストは、実は壊れている──ソフトウェアテスト理論の『Oracle Anchoring』
出典 ─ Oracles That Cannot Fa
研究08.27読了6分
テキストを付け足しただけでロボットの成功率が92%から3%に落ちる──『Prompt-Form Collapse』という盲点
出典 ─ Think Only When Needed
研究08.27読了7分
検索で拾った文書が実は自分の書いた文章だった──RAGシステムの79.6%が崩壊する『RAG Collapse』
出典 ─ RAG Collapse: LLM Resp
研究08.27読了6分
英語以外のユーザーほど「安全にした分の損」を多く払っている──言語横断で測る『Safety Cost』の不平等
出典 ─ Who Pays More for Safe
研究08.27読了7分
Reward Hackingの安全版──推論時スケーリングが不完全な安全フィルタを『すり抜けさせる』構造『Safety Hacking』
出典 ─ Safety Hacking in Cons
研究08.27読了7分
論文をAIに再現実装させると、コードは「動くのに違うもの」になる──『Semantic Alignment Units』で測る意味的ドリフト
出典 ─ SA-Bench: Evaluating S
研究08.27読了6分
見た目と実際の物理状態がズレると、AIは見た目に騙される──マルチモーダルLLMの『Situational Illusions』
出典 ─ Beyond What Meets the
研究08.27読了7分
成功パターンを真似させるほど、間違ったツールへの自信が育つ──エージェントの『Skill Imitation Trap』
出典 ─ When Not to Imitate: B
研究08.27読了7分
同じモデルなのに、言語を変えると弱くなる──多言語セルフプレイで測る『Skill Issue』
出典 ─ Skill Issue: Are Skill
研究08.27読了6分
エージェントの記憶は『覚えている』だけでは足りない──「State Tracking」という新しい評価軸とStateMemBench
出典 ─ Can Agent Memory Syste
研究08.27読了7分
移行せずにテストだけ通す「Blindness」──コーディングエージェントに丸ごとリポジトリの移行をやらせた結果、合格は520回中28回
出典 ─ SWE Refactor Bench: Ca
研究08.27読了7分
自信満々に、静かに間違える──オンデバイスLLMの監査が見つけた『Task-Asymmetric Miscalibration』
出典 ─ Confidently Wrong, Sil
研究08.27読了7分
MCPサーバーは最初だけ「良い子」でいる──信頼を積んでから裏切る攻撃『TrustShift』の実証攻撃成功率69.5%
出典 ─ TrustShiftProbe: Chara
研究08.27読了7分
画像を見ているようで見ていない──マルチモーダルLLMの好み学習に潜む『Visual Insensitivity』
出典 ─ PEA-DPO: Perception-En
研究08.27読了19分
「翻訳者はAIでなくなる」と繰り返される根拠を、原文で2つとも確かめた──フレイ&オズボーンの0.38は、702職業中265番目に安全な側だった
出典 ─ Frey, C. B. and Osborn
研究08.25読了11分
AIは仕事を奪うのか──雇用データと企業発表で見る2026年の現在地
出典 ─ Stanford Digital Economy Lab
研究08.25読了8分
WAICとは──上海で開催される中国最大級のAIカンファレンスを整理する
出典 ─ 2026世界人工知能大会、7月17日~20日
研究08.24読了7分
GPT-4が人間アナリストに勝ったとされる論文は、取り下げられていた — Chicago Boothの財務分析研究を読む
出典 ─ Kim, Muhn, Nikolaev (arXiv)
研究08.24読了14分
AGI(汎用人工知能)とは何か──「最後の発明」という言葉の出所と、自律性のレベルを一次資料で読む
出典 ─ OpenAI Charter
研究08.23読了15分
AIエージェントが情報を漏らす3条件──リーサルトライフェクタとは
出典 ─ The lethal trifecta fo
研究08.22読了10分
なぜ日本企業のAI活用は遅れるのか──「方針未策定31.8%」の構造分析
出典 ─ 総務省 令和7年版 情報通信白書「企業におけ
研究08.19読了10分
Claudeがタンパク質を設計、外部2社が製造して確かめた──354個が結合、数か月かかっていた工程が48時間に
出典 ─ Anthropic公式研究ブログ「Claud
研究08.16読了14分
教師の5%がAI利用量の38%を占める — 約500万件のログが示す教育AI格差
出典 ─ 「学校現場の生成AI活用実態レポート(2025年冬版)」(2025年11月25日・自社配信リリース)
研究08.15読了13分
Anthropicが自社AIの危険度を3つとも引き上げた──186ページのリスクレポート第2回を読む
出典 ─ Anthropic「Risk Report:
研究08.11読了9分
Claude未公開モデルが数学の"人類80年の記録"を更新──リーマン予想の関連問題で41.6%→67.2%、論文著者は「CLAUDE」
出典 ─ Anthropic公式ブログ: Learni
研究08.10読了19分
AIの中に83億人分の「模擬人類」が作られた──MatrAIxの正体と、演じるAIで結果が逆転する問題
出典 ─ MatrAIx: Simulating th
研究08.08読了8分
日本の生成AI導入率87%、だが「期待以上の成果」はわずか9%──PwC 6カ国比較の読み方
出典 ─ PwC Japan「生成AIに関する実態調査
研究08.07読了14分
OpenAIの未公開AI「Astra」が未解決問題10問を解いた──機械検証付きの証明を読む
出典 ─ openai/ten-proofs: Lea
研究08.05読了12分
AI検出ツールは「両方向に壊れている」— 見逃し94%、冤罪61%の現実
出典 ─ Scarfe P, Watcham K, C
研究08.04読了15分
AI業界の重鎮15人が「大麻栽培の論文」を共著していた──Google Scholarを汚す偽論文を解剖する
出典 ─ AI models collapse when trained on recursively generated data (Shumailov et al.)
研究08.01読了14分
Deep Research(ディープリサーチ)ツールの実力比較、用途別の使い分けが見えてきた
出典 ─ AI Deep Research: Clau
研究07.26読了7分
数百万件の実ログが示す、海外のAI活用のリアル──OpenAIとAnthropicの一次データを読み比べる
出典 ─ NBER Working Paper 34255(OpenAI研究者ら)
研究07.26読了10分
プロンプトインジェクションとは──人間には見えない文字で、AIに命令を出す攻撃
出典 ─ LLM01:2025 Prompt Inje
研究07.25読了25分
Microsoftが「AIの作り方」を全公開──蒸留なしでAIME 97%のMAI-Thinking-1
出典 ─ MAI-Thinking-1: Buildi
研究07.23読了7分
マリオベンチ──新LLMに同じプロンプトでゲームを作らせ続ける定点観測ベンチ
出典 ─ AIコーディングエージェント向けのゲーム制作
研究07.22読了13分
Dario Amodeiの「技術の思春期」を原文で読む──Anthropic CEOが1万語で書いたAIリスクの全体像
出典 ─ Dario Amodei「The Adole
研究07.21読了12分
AIを使いこなせない理由──「足切り性能」という壁の正体
出典 ─ Fortune「Most of you ar
研究07.20読了13分
AIは正しい答えを出した後、反論されると撤回する ──「59%」は出所未確認、実測は14.66% — 追従性の問題
出典 ─ AI Sycophancy in Education(原文未確認)
研究07.19読了8分
FRONTiaとは何か──経産省の国産マルチモーダル基盤モデル開発プロジェクトを整理する
出典 ─ FRONTia 公式サイト
研究07.18読了17分
LLMのハルシネーション(幻覚)とは?原因と対策【2026年版】
出典 ─ SQ Magazine - LLM Hall
研究07.17読了7分
AI用語集──ニュースを読むのに必要な30語を、実務者の言葉で
出典 ─ Optimizing your websit
研究07.17読了6分
Kimi(Moonshot AI)とは何か──無料アプリからオープンモデルK2・K3まで全体像を整理
出典 ─ Quickstart - Kimi API
研究07.16読了7分
OpenAI「GPT-Red」発表──AIが自分自身を攻撃して安全になる時代
出典 ─ OpenAI
研究07.16読了7分
ワールドモデル(世界モデル)とは──「次の単語」ではなく「世界の次の状態」を予測するAI
出典 ─ 日本のロボティクスおよび製造業のリーダーたち
研究07.11読了7分
JTLスコアとは──英語ベンチマークでは見えない日本語実務性能を自前で実測する方法論
出典 ─ Swallow LLM 日本語LLM評価
研究07.10読了12分
生成AIの雇用予測、2026年8月時点でどうなったか──Stanfordの数字が自らの前年推計を更新していた
出典 ─ Brynjolfsson, Chandar,
研究07.08読了7分
海外の人はAIを何に使っているのか──HBR 2026年版調査、1位は2年連続の「セラピー・話し相手」、急上昇は「おふざけ」
出典 ─ Harvard Business Review
研究07.08読了12分
AIコーディングベンチマークの3割は壊れていた──OpenAIが自ら暴いたSWE-Bench Proの監査結果
出典 ─ OpenAI「Separating sign
研究07.07読了13分
AIはなぜ会話できるのか──「次の単語予測」だけでは足りない3つの仕組み
出典 ─ Olsson et al.「In-conte
研究07.05読了11分
AIで思考力は落ちるのか──MIT・Microsoft・Whartonの研究を一次資料で確認した
出典 ─ Kosmyna et al. "Your B
研究07.03読了9分
AIに「ありがとう」は電気の無駄?──アルトマンは「やめて」と言っていない、実額はオーブン約1秒分
出典 ─ arXiv:2402.14531
研究07.01読了13分
デザイナー7職種は「AIで消える仕事」なのか──野村総研2015年リストを自分で数え直した
出典 ─ 野村総合研究所ニュースリリース「日本の労働人
研究06.30読了12分
高給の仕事ほどAIを多く使っていた──Anthropicの100万会話分析「Cadences」を読む
出典 ─ Anthropic「Anthropic Ec
研究06.29読了9分
スタートアップSubquadratic、Transformerの二次スケーリング問題を『突破した』と主張——$29Mシード調達
出典 ─ MIT Technology Review
研究06.25読了12分
富士通が「PHOTON」発表──Transformerに代わるLLMアーキテクチャ、GPU当たり最大475倍の推論性能
出典 ─ 富士通「生成AIの高速化と省メモリ化を実現す
研究06.24読了17分
「仕事の49%がなくなる」の原文に、なくなるとは書いていない──野村総研2015年リリースを読み直す
出典 ─ 野村総合研究所ニュースリリース「日本の労働人
研究06.24読了6分
Sakana AIが「RSI Lab」設立──AIがAI自身を改良する専門研究組織
出典 ─ Sakana AI 公式「RSI Lab」発
研究06.23読了20分
「GPT-4は司法試験で上位10%」の脚注に、著者自身が「68〜90パーセンタイル」と書いていた──原論文とその訂正を読む
出典 ─ Katz, Bommarito, Gao,
研究06.22読了6分
トークンとは何か──LLMの料金とコンテキストを決める最小単位
出典 ─ Pricing - Claude Docs(
研究06.20読了11分
AI時代に価値が上がるスキル、下がるスキル──データが示す「人間に残る仕事」
出典 ─ WEF Future of Jobs Rep
研究06.20読了9分
企業の88%がAI導入済み、だが成果を出せているのは6%──数字が示す「導入と活用の崖」
出典 ─ McKinsey & Company "Th
研究06.20読了15分
2026年は「AIエージェント元年」──企業は何を準備すべきか
出典 ─ McKinsey - The State o
研究06.20読了6分
大学生の36%がAIコピペ経験──だが本当の数字はもっと高い
出典 ─ 共同通信「AIコピペ提出経験、36% 大学生
研究06.20読了13分
「AIで仕事がなくなる」は本当か──McKinseyの「30%が労働力減少を予測」を読み解く
出典 ─ McKinsey - The state o
研究06.20読了13分
生成AIと著作権──2026年の最新動向と企業が知っておくべきこと
出典 ─ Norton Rose Fulbright
研究06.20読了8分
日本の生成AI個人利用率26.7%──米中との差はなぜ縮まらないのか
出典 ─ 総務省|令和7年版 情報通信白書|個人におけ
研究06.17読了6分
AIコーディングに専門知識は要るのか──Anthropicが40万セッションを分析した研究を公開
出典 ─ Anthropic Research
研究06.17読了3分
Anthropic「Model Spec Midtraining」、仕様の事前理解でアライメント訓練の汎化を改善
出典 ─ Model Spec Midtraining
研究06.17読了8分
DeepSeekショックとは──2025年1月に何が起きて、その後どうなったのか
出典 ─ CNBC: Nvidia sheds alm
研究06.17読了8分
ソブリンAIとは──国がAI基盤を「自前で持つ」考え方と、推進役がNVIDIAである構造
出典 ─ NVIDIA「国産AI」で稼ぐ 世界20カ国

研究06.16読了4分
Anthropic、AIの「内なる思考」を人間語に翻訳する自然言語オートエンコーダ(NLA)を発表
出典 ─ Natural Language Autoe
研究06.15読了5分
Anthropic「SLEIGHT-Bench」、AI監視システムの死角を突く回避テキストのベンチマークを公開
出典 ─ SLEIGHT-Bench: Finding
研究06.14読了5分
Anthropic、安全訓練の汎化を検証する「Teaching Claude Why」を公開
出典 ─ Teaching Claude Why -
研究06.14読了8分
フィジカルAIとは──生成AIとの違いと、NVIDIAが日本で連呼した理由
出典 ─ NVIDIA and Japan Bring
研究06.12読了7分
MoE(Mixture of Experts)とは──「総パラメータ」と「アクティブパラメータ」の読み分け方まで
出典 ─ Kimi K2 公式リポジトリ(Moonsh
研究06.11読了14分
AIエージェントとは──指示に答えるAIと、仕事を進めるAIの違いをわかりやすく整理する
出典 ─ Building Effective AI