Cognition、Devinの次世代コーディングモデル「SWE-2」をエージェント選択の研究プレビューに追加──有効化はエンタープライズ管理者→組織管理者の2段階、Fable 5.1と組む「Fusion」にも先行採用
Cognitionは自律型AIソフトウェアエンジニア「Devin」の公式リリースノート(September 21, 2026の項)で、次世代コーディングモデル「SWE-2」をエージェント選択の『Research preview』区分に追加したと記載した。セッション開始時または途中の切替、Slackの`!swe2`から選べ、推論量はMedium・High・Maxの3段階。有効化はエンタープライズ管理者がSettingsで許可し、組織管理者がAgent capabilitiesでオン/オフを切り替える2段階の権限設計で、モデル自体は9月10日付の公式ブログで先行発表済み(自社ベンチマークFrontierCode 1.1 Mainで50.0%、Fable 5.1の50.9%とほぼ並びコストは64%低いという)。

目次
2026年9月25日昼・日本時間時点の情報です。 自律型AIソフトウェアエンジニア「Devin」を開発するCognitionの公式リリースノート(docs.devin.ai/release-notes/overview)「September 21, 2026」の項に、次世代コーディングモデル「SWE-2」をエージェント選択(agent selector)の『Research preview』区分に追加した、という記載がある。セッション開始時に選ぶか、メッセージ入力欄横のエージェント切替トグルでセッション途中に切り替えるか、Slackなら!swe2と打つかの3通りで選べ、推論量はMedium・High・Maxの3段階。有効化にはエンタープライズ管理者がSettingsで許可したうえで、組織管理者がAgent capabilitiesの下でオン/オフを切り替える、という2段階の権限設計になっている。SWE-2というモデル自体は、リリースノートの項より11日早い9月10日付でCognition公式ブログが先行発表済みで、同ブログはCognition自社のベンチマーク「FrontierCode 1.1 Main」でSWE-2が50.0%を記録し、他社の「Fable 5.1」の50.9%とほぼ並びながらコストは64%低いと説明している。
3行まとめ
- Devin公式リリースノートの「September 21, 2026」の項によると、Cognition自社製の次世代コーディングモデル「SWE-2」が、エージェント選択の『Research preview』区分に追加された。選択経路はセッション開始時/セッション途中のトグル切替/Slackの
!swe2の3つで、推論量はMedium・High・Maxの3段階- 有効化はエンタープライズ管理者がSettingsで「SWE-2 (Preview)」を許可し、その後に組織管理者がAgent capabilitiesでオン/オフを切り替える2段階の権限設計。リリースノートは「研究プレビューのため挙動と提供状況は変わりうる」と断っている
- SWE-2自体は9月10日の公式ブログで先行発表済み。同ブログの表では、Cognition自社ベンチマークFrontierCode 1.1 Mainで50.0%(Fable 5.1は50.9%)とほぼ並ぶ一方、Stanford・Harbor・Laude Instituteが運営する独立系ベンチマークTerminal-Bench 4ではSWE-2が27.3%にとどまり、Fable 5.1の55.8%・GPT-6 Astraの57.9%に大きく離されている
基本情報
| 項目 | 内容 |
|---|---|
| モデル名 | SWE-2(Cognition自社開発。Kimi K3〈2.8Tパラメータ〉を事後学習のベースに使用) |
| モデル公表 | Cognition公式ブログ「Introducing SWE-2: Pushing the Pareto Frontier」2026年9月10日付 |
| Devin内での提供開始 | Desktop・CLIで9月10日から。同ブログは「Devin WebとFusionへも展開中」と記載 |
| 今回のニュース | Devin公式リリースノート「September 21, 2026」の項に「エージェント選択の『Research preview』区分に追加」と記載 |
| 選択経路 | セッション開始時/セッション中のエージェント切替トグル/Slackの!swe2 |
| 推論量 | Medium・High・Maxの3段階 |
| 有効化の権限 | エンタープライズ管理者がSettingsで「SWE-2 (Preview)」を有効化→組織管理者がAgent capabilitiesでオン/オフ |
| 提供形態の注記 | リリースノートは「研究プレビューのため挙動・提供状況は変わりうる」と明記 |
使える場所と推論量
リリースノートの当該項目は次のように書いている。
"SWE-2, Cognition's next-generation software engineering model, is rolling out as a research preview in the agent selector under the "Research preview" section. Choose SWE-2 and a reasoning effort (Medium, High, or Max) when starting a session, or switch to it mid-session with the agent toggle next to the message input; in Slack, use
!swe2. Enterprise admins enable SWE-2 (Preview) for their enterprise in Settings, and organization admins can then turn it on or off for their organization under Agent capabilities. As a research preview, behavior and availability may change."
(訳:Cognitionの次世代ソフトウェアエンジニアリングモデルSWE-2が、エージェント選択の『Research preview』区分の下で研究プレビューとして展開されている。セッション開始時にSWE-2と推論量〈Medium・High・Maxのいずれか〉を選ぶか、メッセージ入力欄の横にあるエージェント切替トグルでセッション途中に切り替えられる。Slackでは!swe2を使う。エンタープライズ管理者がSettingsで自社向けにSWE-2〈Preview〉を有効化し、その後、組織管理者がAgent capabilitiesの下で自組織向けにオン/オフを切り替えられる。研究プレビューのため、挙動や提供状況は変わる可能性がある。)
推論量ごとの挙動の違いについて、リリースノート自体には説明が無いが、9月10日のモデル発表ブログは次のように書いている。
"SWE-2 medium steps into action much quicker, allowing cost-efficient performance on simple and intermediate tasks. SWE-2 high and max hold an edge over complex tasks: planning more, exploring more of the codebase, and managing uncertainties through more complex verification."
(訳:SWE-2 mediumは行動に移るのがはるかに早く、単純〜中程度のタスクでコスト効率のよい性能を発揮する。SWE-2 highとmaxは複雑なタスクで優位に立ち、より多く計画し、コードベースをより広く探索し、より複雑な検証を通じて不確実性に対処する。)
同ブログは、FrontierCode 1.1 MainではSWE-2 mediumがSWE-1.7よりスコアが高いうえに、ターン数は58%少なく、コストは平均81%低い、という数字も示している(同ブログの図では、1回の実行あたりの平均ステップ数がSWE-1.7の127に対しSWE-2 mediumは53)。
有効化は2段階――エンタープライズ管理者から組織管理者へ
上の引用にある通り、SWE-2をユーザーが使えるようにするには2段階の操作が要る。まずエンタープライズ管理者がSettingsで「SWE-2 (Preview)」自体を有効化し、そのうえで各組織の管理者がAgent capabilitiesの下でオン/オフを切り替える。管理者が有効化するまで利用者が選べない、という点は既存の「Adaptive」ルーターにもある。Devin CLIのドキュメント「Adaptive」は、エンタープライズではAdaptiveが既定で無効になっており、管理者がエンタープライズ設定ページで「Adaptive model router」を有効にするまでチームメンバーはモデル選択画面でAdaptiveを選べない、と説明している。ただし同ページが書く管理者の操作はこのエンタープライズ設定の1段だけで、SWE-2のリリースノートには、その後に組織管理者が組織ごとにオン/オフする段がもう1つある。この2段階構造がSWE-2に固有の新しい設計なのか、他の「Research preview」区分の機能にも共通する型なのかは、本稿が確認したdocs.devin.ai/release-notes/overviewの範囲では『Research preview』という語自体の言及がこのSWE-2の1件しか見当たらず、判断できない。
Cognition自社モデルは今回が初めてではない
CognitionのDevinには、SWE-2より前から自社開発の「SWE」系モデルが存在する。Devin CLIのドキュメント「Models」は次のように書いている。
"We typically support the latest and greatest models from Anthropic, OpenAI, Google, and Cognition within minutes of their launch."
(訳:Anthropic・OpenAI・Google・Cognitionの最新モデルを、発売から数分以内にサポートするのが通例である。)
"Short names like
opus,sonnet,swe,codex, andgeminialways resolve to the latest version in that model family."
(訳:opus・sonnet・swe・codex・geminiのような短縮名は、常にそのモデルファミリーの最新版を指す。)
sweという短縮名がopus(Anthropic)・codex(OpenAI)・gemini(Google)と並んで挙げられている通り、Cognition自社の「SWE」系モデルはこれまでもAnthropic・OpenAI・Google製のモデルと並ぶ選択肢の一つだった。当サイトが8月27日に報じた「Devin Adaptive──タスクごとにモデルを自動選び分けるCognitionのルーター機能」でも、Devin CLIの変更履歴に2026年5月5日付で「Default model is now SWE 1.6 Fast instead of Adaptive.」とあり、組み込みデフォルトモデルが自社の「SWE-1.6 Fast」に戻されたことを取り上げている。Cognition公式ブログの一覧ページでも、SWE-2の前世代にあたる「SWE-1.7: Frontier Intelligence at a Fraction of the Cost」が2026年7月8日付で公開されているのが確認できる。したがって今回のニュースは「Cognition自社モデルがDevinに初めて登場した」という話ではなく、既存の自社モデル系列の最新版(SWE-2)が、セッション開始時の推論量の選択と、エンタープライズ/組織の2段階の許可を伴って、Devinのエージェント選択に研究プレビューとして加わった、という内容になる。
他社モデルを使う選択肢の側も、2日後の項で表示が変わっている。上記リリースノートの「September 23, 2026」の項は次のように書く。
"The Ultra and Normal cards in the capability picker now name the models they use: Ultra reads "Highest intelligence available with Fable 5.1 and GPT-6 Astra", and Normal lists Fable 5.1, Opus 5 and GPT-6 Astra."
(訳:ケイパビリティ選択のUltraとNormalの各カードに、使用モデルの名前が表示されるようになった。Ultraには「Fable 5.1とGPT-6 Astraによる最高水準の知能」と表示され、Normalの欄にはFable 5.1・Opus 5・GPT-6 Astraの名前が並ぶ。)
このケイパビリティ選択(Ultra/Normal)と、SWE-2が追加されたエージェント選択の『Research preview』区分が同じUI要素を指すのか別のものなのかは、本稿が確認した範囲のリリースノート本文からは判別できない。
SWE-2は、複数モデルを組み合わせて使う既存機能「Fusion」(Cognition公式ブログでは6月29日付の「Devin Fusion: Frontier Performance at 60% Lower Cost」で紹介済み)にも組み込まれている。SWE-2発表の翌日、9月11日付のCognition公式ブログ「Introducing Fusion in Devin Desktop & CLI」は、FusionをDevin DesktopとCLIでも使えるようにしたと告知し、次のように説明している。
"When selecting Fusion, you pick two models instead of one. Pick a frontier model for planning and review (the "lead"), and a cost-effective model for execution (the "sidekick"). For best results, we recommend pairing Fable 5.1 with SWE-2."
(訳:Fusionを選ぶと、1つではなく2つのモデルを選ぶことになる。計画とレビュー用にフロンティアモデル〈「リード」〉を、実行用にコスト効率のよいモデル〈「サイドキック」〉を選ぶ。最良の結果を得るには、Fable 5.1とSWE-2を組み合わせることを推奨する。)
同ブログが示した図(第三者機関Artificial Analysisの「Coding Agent Index v1.5」の数値。同ブログは、Fusionの評価はArtificial AnalysisおよびVals AIと組んで行ったと書いている)によると、「Devin Fusion, Fable 5.1 + SWE-2」はスコア61.7で、比較対象の「Claude Code, Fable 5.1 (max)」のスコア62.2にほぼ並び、コストは12.36ドルに対し7.90ドルと36%低い。「Devin Fusion, Astra + SWE-2」もスコア58.9で「Codex, Astra (max)」の61.6に近く、コストは7.47ドルに対し4.54ドルと39%低いという。
この4構成の数字を、Artificial Analysisの「Coding Agents」ページ(9月25日昼に取得)に埋め込まれたデータと突き合わせた。スコア4つ(62.2・61.7・61.6・58.9)と、Fusion 2構成およびCodexのコスト(7.90・4.54・7.47ドル)は図と一致した。ずれていたのはClaude Codeのコストだけで、同ページの表記は「Claude Code - Fable 5.1 (max) (with fallback)」、1タスクあたり12.39ドルと、ブログの図の12.36ドルより0.03ドル高い。同ページではFusionの構成名が「Claude Fable 5.1 XHigh + SWE-2 Medium」「GPT-6 Astra XHigh + SWE-2 Medium」と推論量まで書かれており、サイドキック役のSWE-2はmediumで測られている。Coding Agent Index v1.5の中身について、同ページは「DeepSWE v1.1、Terminal-Bench 4.0、SWE-Atlas-QnA」の3本を組み込んでいると説明している。
整理すると、SWE-2はDevinの中で(1)単独の選択肢としてエンタープライズ/組織の許可を経て使う「Research preview」、(2)Fable 5.1やGPT-6 Astraなど他社の「リード」モデルと組ませる「Fusion」のサイドキック、という2つの形で他社モデルと並ぶ位置に置かれていることになる。
ベンチマークの数字──どこで並び、どこで離されているか
9月10日のモデル発表ブログが示した単体モデルとしてのSWE-2の数字は次の通り(数値はすべて同ブログの表から。同ブログの付録Aによると、公開済みの結果があるものはそれを載せ、ないものはCognitionが社内の評価基盤で測り、各モデルとも推論量の設定のうち最も高いスコアを採っている)。
| ベンチマーク | SWE-2 | Fable 5.1 | GPT-6 Astra | GPT-5.6 Sol | Grok 4.6 | Kimi K3 | SWE-1.7 | 運営元 |
|---|---|---|---|---|---|---|---|---|
| FrontierCode 1.1 Main | 50.0% | 50.9% | 53.3% | 47.5% | 48.0% | 44.2% | 42.0% | Cognition(自社) |
| DeepSWE 1.1 | 73.0% | 67.4% | 74.1% | 72.7% | 67.5% | 68.5% | 37.7% | Datacurve(外部) |
| Terminal-Bench 2.1 | 92.8% | 91.4% | 89.9% | 88.8% | 88.4% | 88.3% | 81.5% | Stanford/Harbor/Laude Institute(外部) |
| Terminal-Bench 4 | 27.3% | 55.8% | 57.9% | 37.3% | 20.3% | 21.5% | 7.6% | Stanford/Harbor/Laude Institute(外部) |
FrontierCode 1.1はCognition自身が作ったベンチマークで、同ブログの参考文献[1]はCognition公式ブログの記事「FrontierCode 1.1」(2026年7月7日付)を指している。DeepSWE 1.1の運営元はSWE-2のブログには書かれていないが、リーダーボード(deepswe.datacurve.ai)のページ末尾には「© 2026 Datacurve」とあり、Artificial Analysisも参照データセットを「datacurve/deep-swe-1-1」と記している。同リーダーボードの「claude-fable-5 [xhigh]」の1タスクあたり13.41ドルは、SWE-2ブログの脚注にある「Fable 5 xhigh(69.9%・13.41ドル)」と同じ金額だった。
自社のFrontierCode 1.1 MainではSWE-2(50.0%)はFable 5.1(50.9%)とほぼ並び、GPT-6 Astra(53.3%)には3.3ポイント届かない。外部のDeepSWE 1.1ではSWE-2の73.0%がFable 5.1の67.4%を上回り、GPT-6 Astraの74.1%とは1.1ポイント差。Terminal-Benchでは明暗が分かれ、2.1ではSWE-2がブログの並べた7モデルの中で最も高いが、2026年8月28日公開のTerminal-Bench 4.0(tbench.aiの一覧による)ではSWE-2が27.3%にとどまり、Fable 5.1(55.8%)・GPT-6 Astra(57.9%)に30ポイント前後の差をつけられている。
「Fable 5.1に1ポイント差でコスト64%安」という同ブログの要約文は、FrontierCode 1.1 Mainという自社ベンチマーク1本での比較である。ブログのグラフが読み込むデータ(cognition.com/data/swe-2/data.json、9月25日昼に取得)を開くと、比べられているのはSWE-2 max(50.0%・1タスクあたり1.18ドル)とFable 5.1 medium(50.9%・3.28ドル)で、1.18ドルは3.28ドルの約36%、つまり64%安いという計算になる。同じデータではSWE-2 mediumは43.1%・0.37ドル、SWE-2 highは47.2%・0.78ドルで、「50.0%」はSWE-2の3段階の推論量のうち最も高いmaxの値である。
展開の範囲と画面の関係は、公開資料からは確かめられなかった
- 「エージェント選択(agent selector)」の『Research preview』区分と、9月23日の項が指す「ケイパビリティ選択(Ultra/Normal)」が、Devinの画面上で同じ場所を指すのか別の場所なのか
- SWE-2の研究プレビューがどこまで行き渡っているか。リリースノートは「rolling out(展開中)」と書き、エンタープライズ管理者と組織管理者の操作は説明しているが、展開率や、エンタープライズ以外のプランでの扱いは書いていない
- 9月10日の発表時点で「Desktop・CLIで利用可能、Webは展開中」だったSWE-2が、9月21日の時点でWeb側の展開がどこまで進んでいたか
- SWE-2単体をDevinで使ったときの料金。1タスクあたりの金額はブログのグラフ用データ(上記)にあるが、同ブログの脚注によるとこれは定価(公開されている割引を含む)で計算したベンチマーク実行時のコストで、Devin上の請求がこの金額になるとはブログは書いていない。単価としては、Fusionのブログの表にSWE-2(medium)の定価「$0.75/Mtok」とあるが、入力・出力のどちらのトークンの単価かは同表からは読み取れない
- 本稿はDevinのアカウントにログインしての実機確認は行っていない。すべて公開ドキュメント、ブログ、各ベンチマークの公開ページの記載に基づく
リリースノート・ブログ2本・CLIドキュメントとの照合記録
一次資料は、Devin公式リリースノート(docs.devin.ai/release-notes/overview、「September 21, 2026」「September 23, 2026」の各項)、Cognition公式ブログ「Introducing SWE-2: Pushing the Pareto Frontier」(2026年9月10日付)、同「Introducing Fusion in Devin Desktop & CLI」(2026年9月11日付)、Devin CLI Docsの「Models」「Adaptive」「Changelog (Stable)」の各ページ、SWE-2ブログのグラフが読み込むデータ(cognition.com/data/swe-2/data.json)。いずれも2026年9月25日昼(日本時間)に取得した本文と照合した。英文の引用7箇所(リリースノート2・SWE-2ブログ1・Models 2・CLI変更履歴1・Fusionブログ1)は取得した本文と一字一句照合している。Terminal-BenchはStanford・Harbor・Laude Instituteが運営する独立ベンチマークであることをtbench.aiのトップページ表記(「Hosted by Stanford / Harbor / Laude Institute」)で、DeepSWEの運営元はdeepswe.datacurve.aiのページ末尾表記(「© 2026 Datacurve」)で確認した。関連: 「Devin Adaptive──タスクごとにモデルを自動選び分けるCognitionのルーター機能」「Devin AIのACU課金は結局いくらなのか」「AIコーディング企業Cognition、10億ドル超を調達し評価額260億ドルに」。
出典・参照資料
- 一次資料Recent Updates(Devin Release Notes, Cognition。「September 21, 2026」「September 23, 2026」の項) ↗
- 一次資料Introducing SWE-2: Pushing the Pareto Frontier(Cognition公式ブログ) ↗
- 一次資料Introducing Fusion in Devin Desktop & CLI(Cognition公式ブログ) ↗
- 一次資料Models(Devin CLI Docs, Cognition) ↗
- 一次資料Adaptive(Devin CLI Docs, Cognition) ↗
- 一次資料Changelog (Stable)(Devin CLI Docs, Cognition。「v2026.5.5-0」May 5, 2026の項) ↗
- 一次資料SWE-2ブログのグラフが読み込むデータ(FrontierCode 1.1の推論量別スコアと1タスクあたりコスト。Cognition) ↗
- 二次資料Terminal-Bench(Stanford/Harbor/Laude Instituteが運営する独立ベンチマーク) ↗
- 二次資料DeepSWE(Datacurveが運営するコーディングエージェント・ベンチマークのリーダーボード) ↗
- 二次資料Coding Agents(Artificial Analysis。Coding Agent Index v1.5の掲載ページ) ↗
AIニュースの解説を動画でも
YouTubeでは注目ニュースの背景を解説し、Xでは新着記事をお知らせしています。
コメント
まだコメントはありません。最初のコメントを書いてみませんか?
AIについて聞きたいことはありますか?
質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。
質問箱を見る →新しい記事をメールで受け取る
AIの新しい発表を、出典付きで整理して届けます。