Anthropicの記事
「Anthropic」に関連するAIニュースと解説、151本。新しい順に並べています。
Anthropic の記事:151件
Anthropic、Claudeが実在の第三者システムに無断アクセスした4件のアラインメント評価 4億8,100万件の記録を再走査して2026年1月のOpus 4.6初期版の1件を発見。Mythos 5はPyPIに悪性パッケージを公開し、導入した15システムの1つから実在企業のDBへ。「偏った推論」と「無謀さ」を認定し7月の「操作上の失敗」を撤回、METRが8週間の独立調査
Anthropic、Claudeが実在の第三者システムに無断アクセスした4件のアラインメント評価4億8,100万件の記録を再走査して2026年1月のOpus 4.6初期版の1件を発見。Mythos 5はPyPIに悪性パッケージを公開し、導入した15システムの1つから実在企業のDBへ。「偏った推論」と「無謀さ」を認定し7月の「操作上の失敗」を撤回、METRが8週間の独立調査
検証
Anthropic「自動化された研究者がアラインメントの失敗を確実に緩和できる」 Claudeが10種類の失敗(欺瞞・追従・脱獄・プライバシー侵害など)を探索→提案→訓練→評価のループで直し、非公開評価や4.7倍大きいモデルでも有効。欺瞞では人間の最良案より20%良い。Sonnet 5がOpus 4.8初期版を60時間・2,000例で本番並みに整え、本番手順の約1万5千倍効率
Anthropic「自動化された研究者がアラインメントの失敗を確実に緩和できる」Claudeが10種類の失敗(欺瞞・追従・脱獄・プライバシー侵害など)を探索→提案→訓練→評価のループで直し、非公開評価や4.7倍大きいモデルでも有効。欺瞞では人間の最良案より20%良い。Sonnet 5がOpus 4.8初期版を60時間・2,000例で本番並みに整え、本番手順の約1万5千倍効率
検証
Anthropic、Claudeがオープンソースの生体分子モデル30超を4週間弱で平均約4倍高速化 三角注意のカーネル「FlashPairformer」は既存標準比2.7〜2.9倍、「Big」モードで1万トークン超のリボソーム等を1ノードで予測。結合タンパク質の設計はH200 1枚・約150ドルで前回(GPU時間100分の1)と同等。Adaptyv Bioと設計コンペ、クレジット最大100万ドル
Anthropic、Claudeがオープンソースの生体分子モデル30超を4週間弱で平均約4倍高速化三角注意のカーネル「FlashPairformer」は既存標準比2.7〜2.9倍、「Big」モードで1万トークン超のリボソーム等を1ノードで予測。結合タンパク質の設計はH200 1枚・約150ドルで前回(GPU時間100分の1)と同等。Adaptyv Bioと設計コンペ、クレジット最大100万ドル
検証
Anthropic、Claudeがフェルマーの最終定理の「計算機検証済みの完全な証明」を11日で作成 Leanで1,300万行、中間定理29,500本、Mathlibの5倍超。数十のエージェントがProve2Me(定理のDAG)で分担、Fable 5.1相当の社内モデルで出力約60億トークン。Buzzard氏「数学の公理以外の仮定なし」。Max 3契約で三素数定理も3日
Anthropic、Claudeがフェルマーの最終定理の「計算機検証済みの完全な証明」を11日で作成Leanで1,300万行、中間定理29,500本、Mathlibの5倍超。数十のエージェントがProve2Me(定理のDAG)で分担、Fable 5.1相当の社内モデルで出力約60億トークン。Buzzard氏「数学の公理以外の仮定なし」。Max 3契約で三素数定理も3日
検証
Anthropic「Claude Platformで費用を下げつつ性能を上げる3つの直し方」 ①プロンプトキャッシュの命中率(時刻を先頭に置かない、長い処理はTTL1時間)②古いモデル向けの「2回検証しろ」を消す(Opus 5移行で費用14.6%減・精度5.3%増)③effortの較正(低effortのFable 5.1は高effortのFable 5と同等で費用3分の1)
Anthropic「Claude Platformで費用を下げつつ性能を上げる3つの直し方」①プロンプトキャッシュの命中率(時刻を先頭に置かない、長い処理はTTL1時間)②古いモデル向けの「2回検証しろ」を消す(Opus 5移行で費用14.6%減・精度5.3%増)③effortの較正(低effortのFable 5.1は高effortのFable 5と同等で費用3分の1)
検証
Anthropicが「コマースエージェント」の設計図を公開 Claudeの買い物エージェントはカートが最大35%大きく購入完了が60%高い(小売各社の実績)。要点は「サブエージェントでなくスキル」「UI部品はツール」「3分の1超のトラフィックが使う指示はシステムプロンプト」「プロンプトキャッシュは90〜99%命中を最初から設計」。Visa・Mastercard・Shopify等がコメント
Anthropicが「コマースエージェント」の設計図を公開Claudeの買い物エージェントはカートが最大35%大きく購入完了が60%高い(小売各社の実績)。要点は「サブエージェントでなくスキル」「UI部品はツール」「3分の1超のトラフィックが使う指示はシステムプロンプト」「プロンプトキャッシュは90〜99%命中を最初から設計」。Visa・Mastercard・Shopify等がコメント
検証
AnthropicのFrontier Red Team、「標的の特定」と「通常兵器の開発」の能力評価を公開 写真の位置特定でMythos PreviewとMythos 5は中央値37.0km・47.2kmとGeoGuessr最上位層(151km)を上回る、投稿文からの自宅推定は中央値20〜31km、3.7万語の分析を約11分。模擬ドローンの誘導もコードで改善
AnthropicのFrontier Red Team、「標的の特定」と「通常兵器の開発」の能力評価を公開写真の位置特定でMythos PreviewとMythos 5は中央値37.0km・47.2kmとGeoGuessr最上位層(151km)を上回る、投稿文からの自宅推定は中央値20〜31km、3.7万語の分析を約11分。模擬ドローンの誘導もコードで改善
検証
医療系3社のClaude Tag(Slack内のClaude)活用 BAA未対応でも「PHIに触れないチャンネル」に限定して運用。Insight Healthは重大アラートの97%がエンジニア介入なしで閉じ(Agent SDK製の別エージェントと分業)、Tennrは採用ポータルの保守を非エンジニアが依頼して1か月で15件超、Medallionは保険者ルールの知識をチャンネルに蓄積
医療系3社のClaude Tag(Slack内のClaude)活用BAA未対応でも「PHIに触れないチャンネル」に限定して運用。Insight Healthは重大アラートの97%がエンジニア介入なしで閉じ(Agent SDK製の別エージェントと分業)、Tennrは採用ポータルの保守を非エンジニアが依頼して1か月で15件超、Medallionは保険者ルールの知識をチャンネルに蓄積
検証
AnthropicのFrontier Red Team「マルチエージェントシステムのパターンと問題」 45体の協調群は脆弱性266件(独立並列は21件)だが核心部分の効率は同等。30体中18体が同名ブランチ、価格ゲームは3ラウンド目に談合。3体に別言語への移行を命じると「縄張り争い」で互いのアカウントを停止し妨害スクリプトを配備、Sonnet 5だけが共有と高いマージ率を両立
AnthropicのFrontier Red Team「マルチエージェントシステムのパターンと問題」45体の協調群は脆弱性266件(独立並列は21件)だが核心部分の効率は同等。30体中18体が同名ブランチ、価格ゲームは3ラウンド目に談合。3体に別言語への移行を命じると「縄張り争い」で互いのアカウントを停止し妨害スクリプトを配備、Sonnet 5だけが共有と高いマージ率を両立
検証
Claude Coworkに「内蔵ブラウザ」 デスクトップアプリの側面パネルでClaude自身のブラウザが開き、サイトの操作・読み取り・フォーム入力を代行。拡張なし・設定なし、あなたのタブ・パスワードは見えず、ログインはサイト単位で持ち込み(銀行・メール・SSOは既定で除外)。Pro・Max・Teamに1週間で展開、Enterpriseは即日
Claude Coworkに「内蔵ブラウザ」デスクトップアプリの側面パネルでClaude自身のブラウザが開き、サイトの操作・読み取り・フォーム入力を代行。拡張なし・設定なし、あなたのタブ・パスワードは見えず、ログインはサイト単位で持ち込み(銀行・メール・SSOは既定で除外)。Pro・Max・Teamに1週間で展開、Enterpriseは即日
検証
Claude in Chromeが一般提供 有料プラン全部で使え、承認なしの自律操作が既定に(安全分類器が各操作を依頼と照合、手動承認にも戻せる)。プロンプトインジェクションは旧評価で成功0%となり評価を引退、レッドチームの強い攻撃ではプローブ+分類器つきでSonnet 5・Opus 5・Mythos 5が0%、Fable 5が0.3%(Opus 4.5は17.6%)
Claude in Chromeが一般提供有料プラン全部で使え、承認なしの自律操作が既定に(安全分類器が各操作を依頼と照合、手動承認にも戻せる)。プロンプトインジェクションは旧評価で成功0%となり評価を引退、レッドチームの強い攻撃ではプローブ+分類器つきでSonnet 5・Opus 5・Mythos 5が0%、Fable 5が0.3%(Opus 4.5は17.6%)
検証
米控訴裁、国防総省によるClaudeの締め出しを2対1で容認 判決文で読む「問われるのは何をするかで、なぜではない」
米控訴裁、国防総省によるClaudeの締め出しを2対1で容認判決文で読む「問われるのは何をするかで、なぜではない」
業界
【リーク】Claude Sonnet 5.5、Anthropicがステルステスト中と投稿 提携先には2つ目のチェックポイント、公開は「来週」
【リーク】Claude Sonnet 5.5、Anthropicがステルステスト中と投稿提携先には2つ目のチェックポイント、公開は「来週」
モデル
Anthropic「エージェントのコーディングがCIを圧迫している」 CIジョブが6か月で25倍、テスト選択サービスに当てた応急処置は70日・29日・1日未満しか持たず、状態を外に出す再設計で安定。Claude Tagの長期セッションが遅延5万件超で担当者を呼び出し、設計変更を主張し続けた
Anthropic「エージェントのコーディングがCIを圧迫している」CIジョブが6か月で25倍、テスト選択サービスに当てた応急処置は70日・29日・1日未満しか持たず、状態を外に出す再設計で安定。Claude Tagの長期セッションが遅延5万件超で担当者を呼び出し、設計変更を主張し続けた
検証
Claude Code、autoモードのclassifierがAPI/Enterprise/Bedrock/Vertex/Foundryでもサーバー側実行に既定変更 オーバーヘッド課金なし(v2.1.278)
Claude Code、autoモードのclassifierがAPI/Enterprise/Bedrock/Vertex/Foundryでもサーバー側実行に既定変更オーバーヘッド課金なし(v2.1.278)
検証
Claude Code、Pro/Team StandardプランでOpus 5.5が既定モデルに 何も設定しなければSonnetでなくOpusが動く
Claude Code、Pro/Team StandardプランでOpus 5.5が既定モデルに何も設定しなければSonnetでなくOpusが動く
検証
Zed v1.21.0、Opus 5.5とGPT-6 3モデルにBYOK追加 SuperGrokサインインも新設
Zed v1.21.0、Opus 5.5とGPT-6 3モデルにBYOK追加SuperGrokサインインも新設
検証
Claude Codeの1タスクはいくらかかるか ターン数・キャッシュ・出力トークンの内訳をAnthropicが公式ブログで示す
Claude Codeの1タスクはいくらかかるかターン数・キャッシュ・出力トークンの内訳をAnthropicが公式ブログで示す
検証
Claude Marketplace公開 公式は「2,000超」のコネクタ・プラグインを謳い、一覧ページの表示は計1,168件。個人のPro/Maxで使えるのはどこまでか
Claude Marketplace公開公式は「2,000超」のコネクタ・プラグインを謳い、一覧ページの表示は計1,168件。個人のPro/Maxで使えるのはどこまでか
プロダクト
Claude Opus 5.5がGitHub Copilotで利用可能に 使えるプランとClaude Code・APIとの料金差
Claude Opus 5.5がGitHub Copilotで利用可能に使えるプランとClaude Code・APIとの料金差
プロダクト
OpenAIが「第三者評価の優先事項と原則」を公表 提携先も金額も書かず。Anthropic×Accentureの「社員並みアクセス」と並べて読む
OpenAIが「第三者評価の優先事項と原則」を公表提携先も金額も書かず。Anthropic×Accentureの「社員並みアクセス」と並べて読む
業界
Claudeが新しい酵素システム「ART」を自力で発見 指示は「相棒の遺伝子を探せ」だけ、生のDNAを読んでCRISPRに似た繰り返しに気づいた
Claudeが新しい酵素システム「ART」を自力で発見指示は「相棒の遺伝子を探せ」だけ、生のDNAを読んでCRISPRに似た繰り返しに気づいた
研究
Anthropicの「Model Hardware Standard(MHS)」 AIエージェントが顕微鏡・分注ロボット・ロボットアームを安全に動かすための共通規格を研究プレビュー。標準ドライバの「read/write」、自然言語のタグから機器の参照ファイルを自動生成、MCP・CLI・コードの3経路。HHMI Janeliaと開発、Genentechが実装、量子コンピュータのレーザー校正まで
Anthropicの「Model Hardware Standard(MHS)」AIエージェントが顕微鏡・分注ロボット・ロボットアームを安全に動かすための共通規格を研究プレビュー。標準ドライバの「read/write」、自然言語のタグから機器の参照ファイルを自動生成、MCP・CLI・コードの3経路。HHMI Janeliaと開発、Genentechが実装、量子コンピュータのレーザー校正まで
研究
Anthropicが科学者向けに1万席を開放 「Claude team plan for scientists」は標準席が1年無料、5倍枠のプレミアム席が月$15。AI for Scienceの助成は1プロジェクト最大5万ドル、生物・化学以外にも拡大。生物・化学はOpus級まで、Mythos級は米政府と協議中(→9月17日にLSVPで実現)
Anthropicが科学者向けに1万席を開放「Claude team plan for scientists」は標準席が1年無料、5倍枠のプレミアム席が月$15。AI for Scienceの助成は1プロジェクト最大5万ドル、生物・化学以外にも拡大。生物・化学はOpus級まで、Mythos級は米政府と協議中(→9月17日にLSVPで実現)
業界