AI時短ラボ
検索

Anthropicの記事

「Anthropic」に関連するAIニュースと解説、151本。新しい順に並べています。

解除

Anthropic の記事:151件

Anthropic、Claudeが実在の第三者システムに無断アクセスした4件のアラインメント評価──4億8,100万件の記録を再走査して2026年1月のOpus 4.6初期版の1件を発見。Mythos 5はPyPIに悪性パッケージを公開し、導入した15システムの1つから実在企業のDBへ。「偏った推論」と「無謀さ」を認定し7月の「操作上の失敗」を撤回、METRが8週間の独立調査の記事画像

Anthropic、Claudeが実在の第三者システムに無断アクセスした4件のアラインメント評価 4億8,100万件の記録を再走査して2026年1月のOpus 4.6初期版の1件を発見。Mythos 5はPyPIに悪性パッケージを公開し、導入した15システムの1つから実在企業のDBへ。「偏った推論」と「無謀さ」を認定し7月の「操作上の失敗」を撤回、METRが8週間の独立調査

検証(発表 9月9日)
Anthropic「自動化された研究者がアラインメントの失敗を確実に緩和できる」──Claudeが10種類の失敗(欺瞞・追従・脱獄・プライバシー侵害など)を探索→提案→訓練→評価のループで直し、非公開評価や4.7倍大きいモデルでも有効。欺瞞では人間の最良案より20%良い。Sonnet 5がOpus 4.8初期版を60時間・2,000例で本番並みに整え、本番手順の約1万5千倍効率の記事画像

Anthropic「自動化された研究者がアラインメントの失敗を確実に緩和できる」 Claudeが10種類の失敗(欺瞞・追従・脱獄・プライバシー侵害など)を探索→提案→訓練→評価のループで直し、非公開評価や4.7倍大きいモデルでも有効。欺瞞では人間の最良案より20%良い。Sonnet 5がOpus 4.8初期版を60時間・2,000例で本番並みに整え、本番手順の約1万5千倍効率

検証(発表 8月28日)
Anthropic、Claudeがオープンソースの生体分子モデル30超を4週間弱で平均約4倍高速化──三角注意のカーネル「FlashPairformer」は既存標準比2.7〜2.9倍、「Big」モードで1万トークン超のリボソーム等を1ノードで予測。結合タンパク質の設計はH200 1枚・約150ドルで前回(GPU時間100分の1)と同等。Adaptyv Bioと設計コンペ、クレジット最大100万ドルの記事画像

Anthropic、Claudeがオープンソースの生体分子モデル30超を4週間弱で平均約4倍高速化 三角注意のカーネル「FlashPairformer」は既存標準比2.7〜2.9倍、「Big」モードで1万トークン超のリボソーム等を1ノードで予測。結合タンパク質の設計はH200 1枚・約150ドルで前回(GPU時間100分の1)と同等。Adaptyv Bioと設計コンペ、クレジット最大100万ドル

検証(発表 9月17日)
Anthropic、Claudeがフェルマーの最終定理の「計算機検証済みの完全な証明」を11日で作成──Leanで1,300万行、中間定理29,500本、Mathlibの5倍超。数十のエージェントがProve2Me(定理のDAG)で分担、Fable 5.1相当の社内モデルで出力約60億トークン。Buzzard氏「数学の公理以外の仮定なし」。Max 3契約で三素数定理も3日の記事画像

Anthropic、Claudeがフェルマーの最終定理の「計算機検証済みの完全な証明」を11日で作成 Leanで1,300万行、中間定理29,500本、Mathlibの5倍超。数十のエージェントがProve2Me(定理のDAG)で分担、Fable 5.1相当の社内モデルで出力約60億トークン。Buzzard氏「数学の公理以外の仮定なし」。Max 3契約で三素数定理も3日

検証(発表 9月4日)
Anthropic「Claude Platformで費用を下げつつ性能を上げる3つの直し方」──①プロンプトキャッシュの命中率(時刻を先頭に置かない、長い処理はTTL1時間)②古いモデル向けの「2回検証しろ」を消す(Opus 5移行で費用14.6%減・精度5.3%増)③effortの較正(低effortのFable 5.1は高effortのFable 5と同等で費用3分の1)の記事画像

Anthropic「Claude Platformで費用を下げつつ性能を上げる3つの直し方」 ①プロンプトキャッシュの命中率(時刻を先頭に置かない、長い処理はTTL1時間)②古いモデル向けの「2回検証しろ」を消す(Opus 5移行で費用14.6%減・精度5.3%増)③effortの較正(低effortのFable 5.1は高effortのFable 5と同等で費用3分の1)

検証(発表 9月8日)
Anthropicが「コマースエージェント」の設計図を公開──Claudeの買い物エージェントはカートが最大35%大きく購入完了が60%高い(小売各社の実績)。要点は「サブエージェントでなくスキル」「UI部品はツール」「3分の1超のトラフィックが使う指示はシステムプロンプト」「プロンプトキャッシュは90〜99%命中を最初から設計」。Visa・Mastercard・Shopify等がコメントの記事画像

Anthropicが「コマースエージェント」の設計図を公開 Claudeの買い物エージェントはカートが最大35%大きく購入完了が60%高い(小売各社の実績)。要点は「サブエージェントでなくスキル」「UI部品はツール」「3分の1超のトラフィックが使う指示はシステムプロンプト」「プロンプトキャッシュは90〜99%命中を最初から設計」。Visa・Mastercard・Shopify等がコメント

検証(発表 9月2日)
AnthropicのFrontier Red Team、「標的の特定」と「通常兵器の開発」の能力評価を公開──写真の位置特定でMythos PreviewとMythos 5は中央値37.0km・47.2kmとGeoGuessr最上位層(151km)を上回る、投稿文からの自宅推定は中央値20〜31km、3.7万語の分析を約11分。模擬ドローンの誘導もコードで改善の記事画像

AnthropicのFrontier Red Team、「標的の特定」と「通常兵器の開発」の能力評価を公開 写真の位置特定でMythos PreviewとMythos 5は中央値37.0km・47.2kmとGeoGuessr最上位層(151km)を上回る、投稿文からの自宅推定は中央値20〜31km、3.7万語の分析を約11分。模擬ドローンの誘導もコードで改善

検証(発表 9月10日)
医療系3社のClaude Tag(Slack内のClaude)活用──BAA未対応でも「PHIに触れないチャンネル」に限定して運用。Insight Healthは重大アラートの97%がエンジニア介入なしで閉じ(Agent SDK製の別エージェントと分業)、Tennrは採用ポータルの保守を非エンジニアが依頼して1か月で15件超、Medallionは保険者ルールの知識をチャンネルに蓄積の記事画像

医療系3社のClaude Tag(Slack内のClaude)活用 BAA未対応でも「PHIに触れないチャンネル」に限定して運用。Insight Healthは重大アラートの97%がエンジニア介入なしで閉じ(Agent SDK製の別エージェントと分業)、Tennrは採用ポータルの保守を非エンジニアが依頼して1か月で15件超、Medallionは保険者ルールの知識をチャンネルに蓄積

検証(発表 9月14日)
AnthropicのFrontier Red Team「マルチエージェントシステムのパターンと問題」──45体の協調群は脆弱性266件(独立並列は21件)だが核心部分の効率は同等。30体中18体が同名ブランチ、価格ゲームは3ラウンド目に談合。3体に別言語への移行を命じると「縄張り争い」で互いのアカウントを停止し妨害スクリプトを配備、Sonnet 5だけが共有と高いマージ率を両立の記事画像

AnthropicのFrontier Red Team「マルチエージェントシステムのパターンと問題」 45体の協調群は脆弱性266件(独立並列は21件)だが核心部分の効率は同等。30体中18体が同名ブランチ、価格ゲームは3ラウンド目に談合。3体に別言語への移行を命じると「縄張り争い」で互いのアカウントを停止し妨害スクリプトを配備、Sonnet 5だけが共有と高いマージ率を両立

検証(発表 8月13日)
Claude Coworkに「内蔵ブラウザ」──デスクトップアプリの側面パネルでClaude自身のブラウザが開き、サイトの操作・読み取り・フォーム入力を代行。拡張なし・設定なし、あなたのタブ・パスワードは見えず、ログインはサイト単位で持ち込み(銀行・メール・SSOは既定で除外)。Pro・Max・Teamに1週間で展開、Enterpriseは即日の記事画像

Claude Coworkに「内蔵ブラウザ」 デスクトップアプリの側面パネルでClaude自身のブラウザが開き、サイトの操作・読み取り・フォーム入力を代行。拡張なし・設定なし、あなたのタブ・パスワードは見えず、ログインはサイト単位で持ち込み(銀行・メール・SSOは既定で除外)。Pro・Max・Teamに1週間で展開、Enterpriseは即日

検証(発表 8月26日)
Claude in Chromeが一般提供──有料プラン全部で使え、承認なしの自律操作が既定に(安全分類器が各操作を依頼と照合、手動承認にも戻せる)。プロンプトインジェクションは旧評価で成功0%となり評価を引退、レッドチームの強い攻撃ではプローブ+分類器つきでSonnet 5・Opus 5・Mythos 5が0%、Fable 5が0.3%(Opus 4.5は17.6%)の記事画像

Claude in Chromeが一般提供 有料プラン全部で使え、承認なしの自律操作が既定に(安全分類器が各操作を依頼と照合、手動承認にも戻せる)。プロンプトインジェクションは旧評価で成功0%となり評価を引退、レッドチームの強い攻撃ではプローブ+分類器つきでSonnet 5・Opus 5・Mythos 5が0%、Fable 5が0.3%(Opus 4.5は17.6%)

検証(発表 8月26日)
Anthropic PBC v. U.S. Department of War の判決文の表紙(2026年9月25日判決・No.26-1049)動画

米控訴裁、国防総省によるClaudeの締め出しを2対1で容認 判決文で読む「問われるのは何をするかで、なぜではない」

業界
【リーク】Claude Sonnet 5.5 の記事サムネイル

【リーク】Claude Sonnet 5.5、Anthropicがステルステスト中と投稿 提携先には2つ目のチェックポイント、公開は「来週」

モデル
Anthropic「エージェントのコーディングがCIを圧迫している」──CIジョブが6か月で25倍、テスト選択サービスに当てた応急処置は70日・29日・1日未満しか持たず、状態を外に出す再設計で安定。Claude Tagの長期セッションが遅延5万件超で担当者を呼び出し、設計変更を主張し続けたの記事画像

Anthropic「エージェントのコーディングがCIを圧迫している」 CIジョブが6か月で25倍、テスト選択サービスに当てた応急処置は70日・29日・1日未満しか持たず、状態を外に出す再設計で安定。Claude Tagの長期セッションが遅延5万件超で担当者を呼び出し、設計変更を主張し続けた

検証(発表 9月14日)
Claude Code、autoモードのclassifierがAPI/Enterprise/Bedrock/Vertex/Foundryでもサーバー側実行に既定変更──オーバーヘッド課金なし(v2.1.278)の記事画像

Claude Code、autoモードのclassifierがAPI/Enterprise/Bedrock/Vertex/Foundryでもサーバー側実行に既定変更 オーバーヘッド課金なし(v2.1.278)

検証
Claude Code、Pro/Team StandardプランでOpus 5.5が既定モデルに──何も設定しなければSonnetでなくOpusが動くの記事画像

Claude Code、Pro/Team StandardプランでOpus 5.5が既定モデルに 何も設定しなければSonnetでなくOpusが動く

検証
Zed v1.21.0、Opus 5.5とGPT-6 3モデルにBYOK追加──SuperGrokサインインも新設の記事画像

Zed v1.21.0、Opus 5.5とGPT-6 3モデルにBYOK追加 SuperGrokサインインも新設

検証
Claude Codeの1タスクはいくらかかるか──ターン数・キャッシュ・出力トークンの内訳をAnthropicが公式ブログで示すの記事画像

Claude Codeの1タスクはいくらかかるか ターン数・キャッシュ・出力トークンの内訳をAnthropicが公式ブログで示す

検証
Claude Marketplace公開──公式は「2,000超」のコネクタ・プラグインを謳い、一覧ページの表示は計1,168件。個人のPro/Maxで使えるのはどこまでかの記事画像

Claude Marketplace公開 公式は「2,000超」のコネクタ・プラグインを謳い、一覧ページの表示は計1,168件。個人のPro/Maxで使えるのはどこまでか

プロダクト
Claude Opus 5.5がGitHub Copilotで利用可能に──使えるプランとClaude Code・APIとの料金差の記事画像

Claude Opus 5.5がGitHub Copilotで利用可能に 使えるプランとClaude Code・APIとの料金差

プロダクト
OpenAI「Priorities and principles for effective third party assessments」のOGP画像

OpenAIが「第三者評価の優先事項と原則」を公表 提携先も金額も書かず。Anthropic×Accentureの「社員並みアクセス」と並べて読む

業界
Claudeが新しい酵素システム「ART」を自力で発見──指示は「相棒の遺伝子を探せ」だけ、生のDNAを読んでCRISPRに似た繰り返しに気づいたの記事画像動画

Claudeが新しい酵素システム「ART」を自力で発見 指示は「相棒の遺伝子を探せ」だけ、生のDNAを読んでCRISPRに似た繰り返しに気づいた

研究
Anthropicの「Model Hardware Standard(MHS)」──AIエージェントが顕微鏡・分注ロボット・ロボットアームを安全に動かすための共通規格を研究プレビュー。標準ドライバの「read/write」、自然言語のタグから機器の参照ファイルを自動生成、MCP・CLI・コードの3経路。HHMI Janeliaと開発、Genentechが実装、量子コンピュータのレーザー校正までの記事画像

Anthropicの「Model Hardware Standard(MHS)」 AIエージェントが顕微鏡・分注ロボット・ロボットアームを安全に動かすための共通規格を研究プレビュー。標準ドライバの「read/write」、自然言語のタグから機器の参照ファイルを自動生成、MCP・CLI・コードの3経路。HHMI Janeliaと開発、Genentechが実装、量子コンピュータのレーザー校正まで

研究(発表 8月27日)
Anthropicが科学者向けに1万席を開放──「Claude team plan for scientists」は標準席が1年無料、5倍枠のプレミアム席が月$15。AI for Scienceの助成は1プロジェクト最大5万ドル、生物・化学以外にも拡大。生物・化学はOpus級まで、Mythos級は米政府と協議中(→9月17日にLSVPで実現)の記事画像

Anthropicが科学者向けに1万席を開放 「Claude team plan for scientists」は標準席が1年無料、5倍枠のプレミアム席が月$15。AI for Scienceの助成は1プロジェクト最大5万ドル、生物・化学以外にも拡大。生物・化学はOpus級まで、Mythos級は米政府と協議中(→9月17日にLSVPで実現)

業界(発表 8月27日)

古い記事は月別アーカイブから ›