AI時短ラボ
モデル· 約26分

Cognition、Devinの次世代コーディングモデル「SWE-2」をエージェント選択の研究プレビューに追加──有効化はエンタープライズ管理者→組織管理者の2段階、Fable 5.1と組む「Fusion」にも先行採用

Cognitionは自律型AIソフトウェアエンジニア「Devin」の公式リリースノート(September 21, 2026の項)で、次世代コーディングモデル「SWE-2」をエージェント選択の『Research preview』区分に追加したと記載した。セッション開始時または途中の切替、Slackの`!swe2`から選べ、推論量はMedium・High・Maxの3段階。有効化はエンタープライズ管理者がSettingsで許可し、組織管理者がAgent capabilitiesでオン/オフを切り替える2段階の権限設計で、モデル自体は9月10日付の公式ブログで先行発表済み(自社ベンチマークFrontierCode 1.1 Mainで50.0%、Fable 5.1の50.9%とほぼ並びコストは64%低いという)。

Cognition「Introducing SWE-2: Pushing the Pareto Frontier」のOG画像
画像:Cognition公式サイト(ブログ記事のOG画像)
執筆・編集:
目次

2026年9月25日昼・日本時間時点の情報です。 自律型AIソフトウェアエンジニア「Devin」を開発するCognitionの公式リリースノート(docs.devin.ai/release-notes/overview)「September 21, 2026」の項に、次世代コーディングモデル「SWE-2」をエージェント選択(agent selector)の『Research preview』区分に追加した、という記載がある。セッション開始時に選ぶか、メッセージ入力欄横のエージェント切替トグルでセッション途中に切り替えるか、Slackなら!swe2と打つかの3通りで選べ、推論量はMedium・High・Maxの3段階。有効化にはエンタープライズ管理者がSettingsで許可したうえで、組織管理者がAgent capabilitiesの下でオン/オフを切り替える、という2段階の権限設計になっている。SWE-2というモデル自体は、リリースノートの項より11日早い9月10日付でCognition公式ブログが先行発表済みで、同ブログはCognition自社のベンチマーク「FrontierCode 1.1 Main」でSWE-2が50.0%を記録し、他社の「Fable 5.1」の50.9%とほぼ並びながらコストは64%低いと説明している。

3行まとめ

  1. Devin公式リリースノートの「September 21, 2026」の項によると、Cognition自社製の次世代コーディングモデル「SWE-2」が、エージェント選択の『Research preview』区分に追加された。選択経路はセッション開始時/セッション途中のトグル切替/Slackの!swe2の3つで、推論量はMedium・High・Maxの3段階
  2. 有効化はエンタープライズ管理者がSettingsで「SWE-2 (Preview)」を許可し、その後に組織管理者がAgent capabilitiesでオン/オフを切り替える2段階の権限設計。リリースノートは「研究プレビューのため挙動と提供状況は変わりうる」と断っている
  3. SWE-2自体は9月10日の公式ブログで先行発表済み。同ブログの表では、Cognition自社ベンチマークFrontierCode 1.1 Mainで50.0%(Fable 5.1は50.9%)とほぼ並ぶ一方、Stanford・Harbor・Laude Instituteが運営する独立系ベンチマークTerminal-Bench 4ではSWE-2が27.3%にとどまり、Fable 5.1の55.8%・GPT-6 Astraの57.9%に大きく離されている

基本情報

項目 内容
モデル名 SWE-2(Cognition自社開発。Kimi K3〈2.8Tパラメータ〉を事後学習のベースに使用)
モデル公表 Cognition公式ブログ「Introducing SWE-2: Pushing the Pareto Frontier」2026年9月10日付
Devin内での提供開始 Desktop・CLIで9月10日から。同ブログは「Devin WebとFusionへも展開中」と記載
今回のニュース Devin公式リリースノート「September 21, 2026」の項に「エージェント選択の『Research preview』区分に追加」と記載
選択経路 セッション開始時/セッション中のエージェント切替トグル/Slackの!swe2
推論量 Medium・High・Maxの3段階
有効化の権限 エンタープライズ管理者がSettingsで「SWE-2 (Preview)」を有効化→組織管理者がAgent capabilitiesでオン/オフ
提供形態の注記 リリースノートは「研究プレビューのため挙動・提供状況は変わりうる」と明記

使える場所と推論量

リリースノートの当該項目は次のように書いている。

"SWE-2, Cognition's next-generation software engineering model, is rolling out as a research preview in the agent selector under the "Research preview" section. Choose SWE-2 and a reasoning effort (Medium, High, or Max) when starting a session, or switch to it mid-session with the agent toggle next to the message input; in Slack, use !swe2. Enterprise admins enable SWE-2 (Preview) for their enterprise in Settings, and organization admins can then turn it on or off for their organization under Agent capabilities. As a research preview, behavior and availability may change."

(訳:Cognitionの次世代ソフトウェアエンジニアリングモデルSWE-2が、エージェント選択の『Research preview』区分の下で研究プレビューとして展開されている。セッション開始時にSWE-2と推論量〈Medium・High・Maxのいずれか〉を選ぶか、メッセージ入力欄の横にあるエージェント切替トグルでセッション途中に切り替えられる。Slackでは!swe2を使う。エンタープライズ管理者がSettingsで自社向けにSWE-2〈Preview〉を有効化し、その後、組織管理者がAgent capabilitiesの下で自組織向けにオン/オフを切り替えられる。研究プレビューのため、挙動や提供状況は変わる可能性がある。)

推論量ごとの挙動の違いについて、リリースノート自体には説明が無いが、9月10日のモデル発表ブログは次のように書いている。

"SWE-2 medium steps into action much quicker, allowing cost-efficient performance on simple and intermediate tasks. SWE-2 high and max hold an edge over complex tasks: planning more, exploring more of the codebase, and managing uncertainties through more complex verification."

(訳:SWE-2 mediumは行動に移るのがはるかに早く、単純〜中程度のタスクでコスト効率のよい性能を発揮する。SWE-2 highとmaxは複雑なタスクで優位に立ち、より多く計画し、コードベースをより広く探索し、より複雑な検証を通じて不確実性に対処する。)

同ブログは、FrontierCode 1.1 MainではSWE-2 mediumがSWE-1.7よりスコアが高いうえに、ターン数は58%少なく、コストは平均81%低い、という数字も示している(同ブログの図では、1回の実行あたりの平均ステップ数がSWE-1.7の127に対しSWE-2 mediumは53)。

有効化は2段階――エンタープライズ管理者から組織管理者へ

上の引用にある通り、SWE-2をユーザーが使えるようにするには2段階の操作が要る。まずエンタープライズ管理者がSettingsで「SWE-2 (Preview)」自体を有効化し、そのうえで各組織の管理者がAgent capabilitiesの下でオン/オフを切り替える。管理者が有効化するまで利用者が選べない、という点は既存の「Adaptive」ルーターにもある。Devin CLIのドキュメント「Adaptive」は、エンタープライズではAdaptiveが既定で無効になっており、管理者がエンタープライズ設定ページで「Adaptive model router」を有効にするまでチームメンバーはモデル選択画面でAdaptiveを選べない、と説明している。ただし同ページが書く管理者の操作はこのエンタープライズ設定の1段だけで、SWE-2のリリースノートには、その後に組織管理者が組織ごとにオン/オフする段がもう1つある。この2段階構造がSWE-2に固有の新しい設計なのか、他の「Research preview」区分の機能にも共通する型なのかは、本稿が確認したdocs.devin.ai/release-notes/overviewの範囲では『Research preview』という語自体の言及がこのSWE-2の1件しか見当たらず、判断できない。

Cognition自社モデルは今回が初めてではない

CognitionのDevinには、SWE-2より前から自社開発の「SWE」系モデルが存在する。Devin CLIのドキュメント「Models」は次のように書いている。

"We typically support the latest and greatest models from Anthropic, OpenAI, Google, and Cognition within minutes of their launch."

(訳:Anthropic・OpenAI・Google・Cognitionの最新モデルを、発売から数分以内にサポートするのが通例である。)

"Short names like opus, sonnet, swe, codex, and gemini always resolve to the latest version in that model family."

(訳:opus・sonnet・swe・codex・geminiのような短縮名は、常にそのモデルファミリーの最新版を指す。)

sweという短縮名がopus(Anthropic)・codex(OpenAI)・gemini(Google)と並んで挙げられている通り、Cognition自社の「SWE」系モデルはこれまでもAnthropic・OpenAI・Google製のモデルと並ぶ選択肢の一つだった。当サイトが8月27日に報じた「Devin Adaptive──タスクごとにモデルを自動選び分けるCognitionのルーター機能」でも、Devin CLIの変更履歴に2026年5月5日付で「Default model is now SWE 1.6 Fast instead of Adaptive.」とあり、組み込みデフォルトモデルが自社の「SWE-1.6 Fast」に戻されたことを取り上げている。Cognition公式ブログの一覧ページでも、SWE-2の前世代にあたる「SWE-1.7: Frontier Intelligence at a Fraction of the Cost」が2026年7月8日付で公開されているのが確認できる。したがって今回のニュースは「Cognition自社モデルがDevinに初めて登場した」という話ではなく、既存の自社モデル系列の最新版(SWE-2)が、セッション開始時の推論量の選択と、エンタープライズ/組織の2段階の許可を伴って、Devinのエージェント選択に研究プレビューとして加わった、という内容になる。

他社モデルを使う選択肢の側も、2日後の項で表示が変わっている。上記リリースノートの「September 23, 2026」の項は次のように書く。

"The Ultra and Normal cards in the capability picker now name the models they use: Ultra reads "Highest intelligence available with Fable 5.1 and GPT-6 Astra", and Normal lists Fable 5.1, Opus 5 and GPT-6 Astra."

(訳:ケイパビリティ選択のUltraとNormalの各カードに、使用モデルの名前が表示されるようになった。Ultraには「Fable 5.1とGPT-6 Astraによる最高水準の知能」と表示され、Normalの欄にはFable 5.1・Opus 5・GPT-6 Astraの名前が並ぶ。)

このケイパビリティ選択(Ultra/Normal)と、SWE-2が追加されたエージェント選択の『Research preview』区分が同じUI要素を指すのか別のものなのかは、本稿が確認した範囲のリリースノート本文からは判別できない。

SWE-2は、複数モデルを組み合わせて使う既存機能「Fusion」(Cognition公式ブログでは6月29日付の「Devin Fusion: Frontier Performance at 60% Lower Cost」で紹介済み)にも組み込まれている。SWE-2発表の翌日、9月11日付のCognition公式ブログ「Introducing Fusion in Devin Desktop & CLI」は、FusionをDevin DesktopとCLIでも使えるようにしたと告知し、次のように説明している。

"When selecting Fusion, you pick two models instead of one. Pick a frontier model for planning and review (the "lead"), and a cost-effective model for execution (the "sidekick"). For best results, we recommend pairing Fable 5.1 with SWE-2."

(訳:Fusionを選ぶと、1つではなく2つのモデルを選ぶことになる。計画とレビュー用にフロンティアモデル〈「リード」〉を、実行用にコスト効率のよいモデル〈「サイドキック」〉を選ぶ。最良の結果を得るには、Fable 5.1とSWE-2を組み合わせることを推奨する。)

同ブログが示した図(第三者機関Artificial Analysisの「Coding Agent Index v1.5」の数値。同ブログは、Fusionの評価はArtificial AnalysisおよびVals AIと組んで行ったと書いている)によると、「Devin Fusion, Fable 5.1 + SWE-2」はスコア61.7で、比較対象の「Claude Code, Fable 5.1 (max)」のスコア62.2にほぼ並び、コストは12.36ドルに対し7.90ドルと36%低い。「Devin Fusion, Astra + SWE-2」もスコア58.9で「Codex, Astra (max)」の61.6に近く、コストは7.47ドルに対し4.54ドルと39%低いという。

この4構成の数字を、Artificial Analysisの「Coding Agents」ページ(9月25日昼に取得)に埋め込まれたデータと突き合わせた。スコア4つ(62.2・61.7・61.6・58.9)と、Fusion 2構成およびCodexのコスト(7.90・4.54・7.47ドル)は図と一致した。ずれていたのはClaude Codeのコストだけで、同ページの表記は「Claude Code - Fable 5.1 (max) (with fallback)」、1タスクあたり12.39ドルと、ブログの図の12.36ドルより0.03ドル高い。同ページではFusionの構成名が「Claude Fable 5.1 XHigh + SWE-2 Medium」「GPT-6 Astra XHigh + SWE-2 Medium」と推論量まで書かれており、サイドキック役のSWE-2はmediumで測られている。Coding Agent Index v1.5の中身について、同ページは「DeepSWE v1.1、Terminal-Bench 4.0、SWE-Atlas-QnA」の3本を組み込んでいると説明している。

整理すると、SWE-2はDevinの中で(1)単独の選択肢としてエンタープライズ/組織の許可を経て使う「Research preview」、(2)Fable 5.1やGPT-6 Astraなど他社の「リード」モデルと組ませる「Fusion」のサイドキック、という2つの形で他社モデルと並ぶ位置に置かれていることになる。

ベンチマークの数字──どこで並び、どこで離されているか

9月10日のモデル発表ブログが示した単体モデルとしてのSWE-2の数字は次の通り(数値はすべて同ブログの表から。同ブログの付録Aによると、公開済みの結果があるものはそれを載せ、ないものはCognitionが社内の評価基盤で測り、各モデルとも推論量の設定のうち最も高いスコアを採っている)。

ベンチマーク SWE-2 Fable 5.1 GPT-6 Astra GPT-5.6 Sol Grok 4.6 Kimi K3 SWE-1.7 運営元
FrontierCode 1.1 Main 50.0% 50.9% 53.3% 47.5% 48.0% 44.2% 42.0% Cognition(自社)
DeepSWE 1.1 73.0% 67.4% 74.1% 72.7% 67.5% 68.5% 37.7% Datacurve(外部)
Terminal-Bench 2.1 92.8% 91.4% 89.9% 88.8% 88.4% 88.3% 81.5% Stanford/Harbor/Laude Institute(外部)
Terminal-Bench 4 27.3% 55.8% 57.9% 37.3% 20.3% 21.5% 7.6% Stanford/Harbor/Laude Institute(外部)

FrontierCode 1.1はCognition自身が作ったベンチマークで、同ブログの参考文献[1]はCognition公式ブログの記事「FrontierCode 1.1」(2026年7月7日付)を指している。DeepSWE 1.1の運営元はSWE-2のブログには書かれていないが、リーダーボード(deepswe.datacurve.ai)のページ末尾には「© 2026 Datacurve」とあり、Artificial Analysisも参照データセットを「datacurve/deep-swe-1-1」と記している。同リーダーボードの「claude-fable-5 [xhigh]」の1タスクあたり13.41ドルは、SWE-2ブログの脚注にある「Fable 5 xhigh(69.9%・13.41ドル)」と同じ金額だった。

自社のFrontierCode 1.1 MainではSWE-2(50.0%)はFable 5.1(50.9%)とほぼ並び、GPT-6 Astra(53.3%)には3.3ポイント届かない。外部のDeepSWE 1.1ではSWE-2の73.0%がFable 5.1の67.4%を上回り、GPT-6 Astraの74.1%とは1.1ポイント差。Terminal-Benchでは明暗が分かれ、2.1ではSWE-2がブログの並べた7モデルの中で最も高いが、2026年8月28日公開のTerminal-Bench 4.0(tbench.aiの一覧による)ではSWE-2が27.3%にとどまり、Fable 5.1(55.8%)・GPT-6 Astra(57.9%)に30ポイント前後の差をつけられている。

「Fable 5.1に1ポイント差でコスト64%安」という同ブログの要約文は、FrontierCode 1.1 Mainという自社ベンチマーク1本での比較である。ブログのグラフが読み込むデータ(cognition.com/data/swe-2/data.json、9月25日昼に取得)を開くと、比べられているのはSWE-2 max(50.0%・1タスクあたり1.18ドル)とFable 5.1 medium(50.9%・3.28ドル)で、1.18ドルは3.28ドルの約36%、つまり64%安いという計算になる。同じデータではSWE-2 mediumは43.1%・0.37ドル、SWE-2 highは47.2%・0.78ドルで、「50.0%」はSWE-2の3段階の推論量のうち最も高いmaxの値である。

展開の範囲と画面の関係は、公開資料からは確かめられなかった

  • 「エージェント選択(agent selector)」の『Research preview』区分と、9月23日の項が指す「ケイパビリティ選択(Ultra/Normal)」が、Devinの画面上で同じ場所を指すのか別の場所なのか
  • SWE-2の研究プレビューがどこまで行き渡っているか。リリースノートは「rolling out(展開中)」と書き、エンタープライズ管理者と組織管理者の操作は説明しているが、展開率や、エンタープライズ以外のプランでの扱いは書いていない
  • 9月10日の発表時点で「Desktop・CLIで利用可能、Webは展開中」だったSWE-2が、9月21日の時点でWeb側の展開がどこまで進んでいたか
  • SWE-2単体をDevinで使ったときの料金。1タスクあたりの金額はブログのグラフ用データ(上記)にあるが、同ブログの脚注によるとこれは定価(公開されている割引を含む)で計算したベンチマーク実行時のコストで、Devin上の請求がこの金額になるとはブログは書いていない。単価としては、Fusionのブログの表にSWE-2(medium)の定価「$0.75/Mtok」とあるが、入力・出力のどちらのトークンの単価かは同表からは読み取れない
  • 本稿はDevinのアカウントにログインしての実機確認は行っていない。すべて公開ドキュメント、ブログ、各ベンチマークの公開ページの記載に基づく

リリースノート・ブログ2本・CLIドキュメントとの照合記録

一次資料は、Devin公式リリースノート(docs.devin.ai/release-notes/overview、「September 21, 2026」「September 23, 2026」の各項)、Cognition公式ブログ「Introducing SWE-2: Pushing the Pareto Frontier」(2026年9月10日付)、同「Introducing Fusion in Devin Desktop & CLI」(2026年9月11日付)、Devin CLI Docsの「Models」「Adaptive」「Changelog (Stable)」の各ページ、SWE-2ブログのグラフが読み込むデータ(cognition.com/data/swe-2/data.json)。いずれも2026年9月25日昼(日本時間)に取得した本文と照合した。英文の引用7箇所(リリースノート2・SWE-2ブログ1・Models 2・CLI変更履歴1・Fusionブログ1)は取得した本文と一字一句照合している。Terminal-BenchはStanford・Harbor・Laude Instituteが運営する独立ベンチマークであることをtbench.aiのトップページ表記(「Hosted by Stanford / Harbor / Laude Institute」)で、DeepSWEの運営元はdeepswe.datacurve.aiのページ末尾表記(「© 2026 Datacurve」)で確認した。関連: 「Devin Adaptive──タスクごとにモデルを自動選び分けるCognitionのルーター機能」「Devin AIのACU課金は結局いくらなのか」「AIコーディング企業Cognition、10億ドル超を調達し評価額260億ドルに」。

シェア: ポスト はてブ

出典・参照資料

AIニュースの解説を動画でも

YouTubeでは注目ニュースの背景を解説し、Xでは新着記事をお知らせしています。

コメント

まだコメントはありません。最初のコメントを書いてみませんか?

AIについて聞きたいことはありますか?

質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。

質問箱を見る →

新しい記事をメールで受け取る

AIの新しい発表を、出典付きで整理して届けます。

関連記事

Devin Adaptive──タスクごとにモデルを自動選び分けるCognitionのルーター機能の記事画像
活用08.27読了19分

Devin Adaptive──タスクごとにモデルを自動選び分けるCognitionのルーター機能

出典 ─ Adaptive
Devin AIのACU課金は結局いくらなのか──公式ドキュメントを読むと「非公開」という答えに行き着くの記事画像
プロダクト09.04読了12分

Devin AIのACU課金は結局いくらなのか──公式ドキュメントを読むと「非公開」という答えに行き着く

出典 ─ Enterprise Billing
AIコーディング企業Cognition、10億ドル超を調達し評価額260億ドルにの記事画像
業界07.28読了3分

AIコーディング企業Cognition、10億ドル超を調達し評価額260億ドルに

出典 ─ AI coding startup Cogn
GPT-6 AstraとClaude Fable 5.1の公式比較資料を並べた画像
モデル09.18読了25分

GPT-6 Astra vs Claude Fable 5.1 比較──同じ$10/$50で何が違うか。公式ベンチの突合・独立指標・プラン別に使える条件・キャッシュ単価の4倍差を1枚に

出典 ─ OpenAI公式ブログ(比較表・脚注・2026-09-03)
Kimi K3の「Dynamic Tool Loading」──ツール定義を会話の途中で継ぎ足す設計の記事画像
モデル09.03読了13分

Kimi K3の「Dynamic Tool Loading」──ツール定義を会話の途中で継ぎ足す設計

出典 ─ Kimi API Platform 公式ドキュメント
GPT-6のプロンプトキャッシュ改善を読む──割引90%・書き込み1.25倍・TTL30分はGPT-5.6と同じ、ダッシュボードと診断ツールは8〜9月に公開済み、発表前日のガイドに無かったのはプリウォームの記事画像
プロダクト09.24読了24分

GPT-6のプロンプトキャッシュ改善を読む──割引90%・書き込み1.25倍・TTL30分はGPT-5.6と同じ、ダッシュボードと診断ツールは8〜9月に公開済み、発表前日のガイドに無かったのはプリウォーム

出典 ─ Better prompt caching
GPT-6 AstraをPerplexityとCognition(Devin)はどう使っているか──OpenAIの事例2本(日本語版あり)。Perplexityは「本番システムを監視させ、確認の頻度を大きく減らした」、DevinはAstraで自分の成果物をテストして録画とレポートを返すの記事画像
業界09.22読了8分

GPT-6 AstraをPerplexityとCognition(Devin)はどう使っているか──OpenAIの事例2本(日本語版あり)。Perplexityは「本番システムを監視させ、確認の頻度を大きく減らした」、DevinはAstraで自分の成果物をテストして録画とレポートを返す

出典 ─ OpenAI(日本語版・2026年9月14日・9月18日取得)
Claude Opus 5.5は本当に最強か──第三者ベンチマーク2社で総合1位、研究課題で初の人間基準超え。ただしフォールバック込みの数字と、筆者が見た「暴れ馬」の癖の記事画像
モデル09.24読了13分

Claude Opus 5.5は本当に最強か──第三者ベンチマーク2社で総合1位、研究課題で初の人間基準超え。ただしフォールバック込みの数字と、筆者が見た「暴れ馬」の癖

出典 ─ Anthropic公式発表「Claude O