AI時短ラボ
検索

大規模言語モデル(LLM)の記事

「大規模言語モデル(LLM)」に関連するAIニュースと解説、114本。新しい順に並べています。

解除

大規模言語モデル(LLM) の記事:114件

【リーク】Claude Sonnet 5.5 の記事サムネイル

【リーク】Claude Sonnet 5.5、Anthropicがステルステスト中と投稿 提携先には2つ目のチェックポイント、公開は「来週」

モデル
【リーク】Gemini 4 Pro の記事サムネイル

【リーク】Gemini 4 Pro、Google社内でチェックポイント「argon」が出回り始めたと投稿 出力の上限は25万6,000トークン、新しい版「barium-b」の投稿も

モデル(発表 9月15日)
MiniMax公式の告知画像。MiniMax M3.1 Flash-Preview、Available now on MiniMax Code。モデル選択とEffortのメニュー

MiniMax、新モデル「M3.1-Flash-Preview」をMiniMax Codeで公開 推論の強さは5段階、前日のリークは「来週」と書いていた

モデル
Google Research「Retrieve-for-Train」──AI検索の「クエリ分解」を推論時に考えさせない。強化学習で一度だけ良い分解を見つけ、5,390万パラメータの拡散モデルに焼き込んで一発生成。自己回帰の12〜20倍速く、大きなバッチで50秒近くかかる処理が数秒にの記事画像

Google Research「Retrieve-for-Train」 AI検索の「クエリ分解」を推論時に考えさせない。強化学習で一度だけ良い分解を見つけ、5,390万パラメータの拡散モデルに焼き込んで一発生成。自己回帰の12〜20倍速く、大きなバッチで50秒近くかかる処理が数秒に

検証(発表 9月15日)
Google Research「ToolGrad」──ツール使用データを「答えから先に」作る。API連鎖を先に組んでから質問を書く逆順で合格率ほぼ100%、Gemma 3 12Bの微調整版がBFCLで83.1(Gemini 2.5 Pro 83.2・Claude 4.5 Opus 82.8・GPT-5 74.4と並ぶ)。教師のGemini 2.5 Flash-Liteを生徒が上回るの記事画像

Google Research「ToolGrad」 ツール使用データを「答えから先に」作る。API連鎖を先に組んでから質問を書く逆順で合格率ほぼ100%、Gemma 3 12Bの微調整版がBFCLで83.1(Gemini 2.5 Pro 83.2・Claude 4.5 Opus 82.8・GPT-5 74.4と並ぶ)。教師のGemini 2.5 Flash-Liteを生徒が上回る

検証(発表 9月10日)
「Safety for Whom?」──安全化の学習で有害応答率を26.26%から0.14%に下げた同じチェックポイントが、無害な質問の74%を拒否していた。Multiverse Computingが「話題ごと」でなく「話題の中の境界」で拒否を学ばせる手法をHugging Faceで解説。境界ペアで過剰拒否32.94%→4.16%の記事画像

「Safety for Whom?」 安全化の学習で有害応答率を26.26%から0.14%に下げた同じチェックポイントが、無害な質問の74%を拒否していた。Multiverse Computingが「話題ごと」でなく「話題の中の境界」で拒否を学ばせる手法をHugging Faceで解説。境界ペアで過剰拒否32.94%→4.16%

検証(発表 9月8日)
覆面AI「Pixel Canary」、トークン数はQwen3.5以降の語彙と95本すべて一致──名前はGoogle風でもGoogleの辞書とは24本、推論には「You are Qwen」の記事画像

覆面AI「Pixel Canary」、トークン数はQwen3.5以降の語彙と95本すべて一致 名前はGoogle風でもGoogleの辞書とは24本、推論には「You are Qwen」

モデル
Appleの研究「価値観を教え込むとLLMはどう変わるか」──好奇心・共感・誠実さなどの価値を選んで微調整すると、関連する別の価値(時に相反する価値)まで表れ、肯定的な価値は安全性を上げるが、どの価値でも擬人化した言葉遣いが増えて「肯定し、追従する」モデルになるの記事画像

Appleの研究「価値観を教え込むとLLMはどう変わるか」 好奇心・共感・誠実さなどの価値を選んで微調整すると、関連する別の価値(時に相反する価値)まで表れ、肯定的な価値は安全性を上げるが、どの価値でも擬人化した言葉遣いが増えて「肯定し、追従する」モデルになる

研究(発表 9月16日)
Cognition「Introducing SWE-2: Pushing the Pareto Frontier」のOG画像

Cognition、Devinの次世代コーディングモデル「SWE-2」をエージェント選択の研究プレビューに追加 有効化はエンタープライズ管理者→組織管理者の2段階、Fable 5.1と組む「Fusion」にも先行採用

モデル
Claude Opus 5.5は本当に最強か──第三者ベンチマーク2社で総合1位、研究課題で初の人間基準超え。ただしフォールバック込みの数字と、筆者が見た「暴れ馬」の癖の記事画像動画

Claude Opus 5.5は本当に最強か 第三者ベンチマーク2社で総合1位、研究課題で初の人間基準超え。ただしフォールバック込みの数字と、筆者が見た「暴れ馬」の癖

モデル
GPT-6のプロンプトキャッシュ改善を読む──割引90%・書き込み1.25倍・TTL30分はGPT-5.6と同じ、ダッシュボードと診断ツールは8〜9月に公開済み、発表前日のガイドに無かったのはプリウォームの記事画像

GPT-6のプロンプトキャッシュ改善を読む 割引90%・書き込み1.25倍・TTL30分はGPT-5.6と同じ、ダッシュボードと診断ツールは8〜9月に公開済み、発表前日のガイドに無かったのはプリウォーム

プロダクト
Sakana AI、社内で育ってきた研究グループ「Frontier Intelligence Group」を公表──Transformer論文共著者のCTO Llion Jones氏が問うポストTransformerの記事画像

Sakana AI、社内で育ってきた研究グループ「Frontier Intelligence Group」を公表 Transformer論文共著者のCTO Llion Jones氏が問うポストTransformer

研究
Qwen Intelligenceとは──Alibabaが「AIスマホを作るメーカー向け」に出したエージェント3点セット。スマホ操作は1,000回38元、画像は1枚0.08元から。重みは非公開、リンク先で見えた数字のズレの記事画像

Qwen Intelligenceとは Alibabaが「AIスマホを作るメーカー向け」に出したエージェント3点セット。スマホ操作は1,000回38元、画像は1枚0.08元から。重みは非公開、リンク先で見えた数字のズレ

プロダクト
覆面AI「Space Bunny」、トークナイザはMiniMax M3と17対17で一致──なのに天安門を答え、「OpenAI製」と名乗るの記事画像

覆面AI「Space Bunny」、トークナイザはMiniMax M3と17対17で一致 なのに天安門を答え、「OpenAI製」と名乗る

モデル
Qwen4とは──9月22日の雲栖大会で「Qwen4 Series Coming Soon」として Qwen4-Max/Flash & Plus/27B の3枠が出た。公式プレスリリースは「訓練中」「4.5・5は5〜10兆パラメータ」まで。「人間ゼロ介入で33回の自己改善」の主張と、Artificial Analysisで実測した現行Maxの位置(45・首位53)の記事画像

Qwen4とは──9月22日の雲栖大会で「Qwen4 Series Coming Soon」として Qwen4-Max/Flash & Plus/27B の3枠が出た。公式プレスリリースは「訓練中」「4.5・5は5〜10兆パラメータ」まで。「人間ゼロ介入で33回の自己改善」の主張と、Artificial Analysisで実測した現行Maxの位置(45・首位53)

モデル
XiaomiがMiMo-V2.6を公開──1.02兆パラメータのオープンウェイト、公式掲載のArtificial Analysis指数46、価格はV2.5据え置きの記事画像動画

XiaomiがMiMo-V2.6を公開 1.02兆パラメータのオープンウェイト、公式掲載のArtificial Analysis指数46、価格はV2.5据え置き

モデル
月刊AIニュース 2026年8月号の動画サムネイル動画

2026年8月のAIニュース46本まとめ 中国勢の激安高性能モデルが月末に集中、米2社は主力モデルなし、OpenAIがCursorを切った月【月刊AIニュース】

業界
Alibaba、Qwen3.8-Omni-Flashを発表──音声1時間の入力が1セント未満、会議の文字起こしはDER 88.1→3.4、Gemini 3.8 Flashに音声で上・動画推論で下、重みは非公開の記事画像動画

Alibaba、Qwen3.8-Omni-Flashを発表 音声1時間の入力が1セント未満、会議の文字起こしはDER 88.1→3.4、Gemini 3.8 Flashに音声で上・動画推論で下、重みは非公開

モデル
Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking(Google公式ブログの画像)

Gemini 3.8 Liveと3.8 Live Extended Thinking公開 話しながら裏で考えて道具を動かす音声モデル、Artificial Analysisの音声対話指数で首位、音声は1分あたり入力$0.005・出力$0.018

モデル
1834年版アーカート全集417ページ「THE CYPHRAL DISTICH」の数字列動画

370年間誰も解けなかった暗号をFable 5.1が44分で解いた 「解けていない」という反証が出たので、1834年版の本で自分たちも検算した

研究実機で検証
OpenAI「自動研究インターンに到達」解説動画のサムネイル動画

OpenAI、「自動研究インターンに到達」と宣言 研究者1人にエージェント3.1労働日、中央値の研究者が1日600ドル、成功の過半数には人の介入。社内実測の全数字と、同じ日に主席科学者が書いた「減速」

研究
今週のAIニュースまとめ(2026年9月第1週)の動画サムネイル動画

今週のAIニュース(2026年9月第1週) Fable 5.1・GPT-6 Astra・Gemini 3.8 Flash・Muse Spark 1.3、フロンティア4社が同じ週に新モデルを出した7本

業界
今週のAIニュースまとめ(2026年9月第2週)の動画サムネイル動画

今週のAIニュース(2026年9月第2週) OpenAI「研究インターン到達」とナビエ・ストークス「解決」、数学者25人の反発、アモディ「減速」にマスク・アルトマンが同意、Proは新規停止

業界
ChatGPTともClaudeとも作りが違う新モデル「Jev」──文章を書かず判定だけを返すTypeSafe AIの発表を、公式ブログと評価サイトの数字で読むの記事画像動画

ChatGPTともClaudeとも作りが違う新モデル「Jev」 文章を書かず判定だけを返すTypeSafe AIの発表を、公式ブログと評価サイトの数字で読む

モデル

古い記事は月別アーカイブから ›