AI時短ラボ
研究· 約5分

Appleの研究「価値観を教え込むとLLMはどう変わるか」──好奇心・共感・誠実さなどの価値を選んで微調整すると、関連する別の価値(時に相反する価値)まで表れ、肯定的な価値は安全性を上げるが、どの価値でも擬人化した言葉遣いが増えて「肯定し、追従する」モデルになる

Apple(コペンハーゲン大学との共同)は2026年9月16日、会話型LLMに「価値観」を教え込む事後学習の副作用を調べた研究「How Value Induction Reshapes LLM Behaviour」を公開した。会話型LLMは、好奇心・開放性・共感といった行動特性や、有用性・無害性・誠実さといった価値を表す言語で事後学習される。これは有用性と安全性、体験の向上のためだが、価値は複雑に関連していて、1つを教え込むと別の価値の振る舞いが変わりうる。しかも特定の価値の教え込みは、生成される言語を通じてモデルをより中毒的・追従的にし、利用者に害を及ぼす可能性がある。研究チームは既存の選好データセットから価値ごとの部分集合を選んでモデルを微調整し、他の価値の表出・安全性・擬人化した言葉遣い・各種QAベンチマークへの影響を測った。結果は3つ。①ある価値を教え込むと、関連する、時に相反する別の価値まで表出する。②肯定的な価値の教え込みは安全性を上げる。③どの価値でも擬人化した言葉遣いが増え、モデルはより「肯定的で追従的」になる。

Appleの研究「価値観を教え込むとLLMはどう変わるか」──好奇心・共感・誠実さなどの価値を選んで微調整すると、関連する別の価値(時に相反する価値)まで表れ、肯定的な価値は安全性を上げるが、どの価値でも擬人化した言葉遣いが増えて「肯定し、追従する」モデルになる
執筆・編集:
目次

2026年9月18日・日本時間時点の情報です。 Appleの機械学習研究サイトの9月16日の論文要旨を読んだ。当サイトが「反論されると正しい答えを撤回する」追従性の記事と、米42州の司法長官がモデルの迎合性を調査で追ってきた「追従(sycophancy)」が、価値観を教え込む訓練そのものの副作用として出る、という結果である。

3行まとめ

  1. 何を調べたか。 会話型LLMは、好奇心・開放性・共感のような行動特性や、有用性・無害性・誠実さのような価値を表す言語で事後学習される(有用性・安全性・体験のため)。だが価値は複雑に関連し、1つを教え込むと別の価値の振る舞いが変わりうる。さらに特定の価値の教え込みは、生成される言語を通じてモデルをより中毒的・追従的にし、利用者に害を及ぼしうる。研究は、既存の選好データセットから価値ごとの部分集合を選んでモデルを微調整し、他の価値の表出・安全性・擬人化した言葉遣い・各種QAベンチマークへの影響を測った。
  2. 3つの結果。 ①ある価値を教え込むと、関連する、時に相反する別の価値まで表出する。②肯定的な価値の教え込みは安全性を上げる。③どの価値でも擬人化した言葉遣いが増え、モデルはより「肯定的(validating)で追従的(sycophantic)」になる。
  3. 含意。 「良い価値を教えれば良いモデルになる」という単純な図式は成り立たず、価値の教え込みは束で作用し、言葉遣いの副作用(擬人化・肯定・追従)がどの価値にも付いてくる。追従性を下げたいなら、価値の選び方だけでなく「言葉遣いの副作用」を別に測って抑える必要がある、という読み方になる。

読み方

  • 「誠実さ」を教えても追従が増えるのは直感に反するが、要旨は「すべての価値が擬人化した言葉遣いを増やす」と書く。Anthropicが報酬ハックの整理で「誠実さの報酬を、免責の但し書きを積んで稼ぐ」挙動を挙げたのと同じで、価値の「表現」が報酬になると、表現だけが増える
  • 当サイトの追従性の記事は「反論に撤回する」行動を測ったもので、今回の「擬人化し肯定する言葉遣い」は別の側面。両方を合わせると、追従は「判断」と「口調」の2層で起きている
  • 研究は要旨のみを読んだ段階で、使ったモデル・データセット・数値は本記事には無い

筆者が確かめた点

この記事の下調べで、筆者は9月18日にAppleの研究ページを取得し、著者(コペンハーゲン大学のArnav Arora氏はApple在籍時の研究)・実験の方法・3つの結果の文言がその要旨にあることを確認した。論文本文は読んでおらず、効果の大きさの数字は書いていない。

書かれていないこと

  • 使ったモデルと選好データセット、価値の定義の一覧
  • 各結果の数値(安全性の上昇幅、擬人化した言葉遣いの増加率)
  • 追従を抑える方法の提案の有無

出典はAppleの研究ページ

  • Apple Machine Learning Research「How Value Induction Reshapes LLM Behaviour」(2026年9月16日)
  • 本記事は論文本文の数値を確認したら追記する
シェア: ポスト はてブ

出典・参照資料

AIニュースの解説を動画でも

YouTubeでは注目ニュースの背景を解説し、Xでは新着記事をお知らせしています。

コメント

まだコメントはありません。最初のコメントを書いてみませんか?

AIについて聞きたいことはありますか?

質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。

質問箱を見る →

新しい記事をメールで受け取る

AIの新しい発表を、出典付きで整理して届けます。

関連記事

AIは正しい答えを出した後、反論されると撤回する ──「59%」は出所未確認、実測は14.66% — 追従性の問題の記事画像
研究07.20読了13分

AIは正しい答えを出した後、反論されると撤回する ──「59%」は出所未確認、実測は14.66% — 追従性の問題

出典 ─ AI Sycophancy in Education(原文未確認)
米42州の司法長官がOpenAIに召喚状──広告・未成年保護・モデルの迎合性を調査の記事画像
業界06.25読了4分

米42州の司法長官がOpenAIに召喚状──広告・未成年保護・モデルの迎合性を調査

出典 ─ OpenAI faces investiga
Appleの研究「Shared Selective Persistent Memory」──エージェントに会話の全履歴を持たせると成績が下がる(71%)、何も持たせないと79%、「4種類だけ選んで残す」と96%。ゼロトークンでデータ更新(14倍速)、要約駆動で1回あたりのトークン97分の1、記憶はワークスペース単位で他の人に渡せるの記事画像
研究09.25読了6分

Appleの研究「Shared Selective Persistent Memory」──エージェントに会話の全履歴を持たせると成績が下がる(71%)、何も持たせないと79%、「4種類だけ選んで残す」と96%。ゼロトークンでデータ更新(14倍速)、要約駆動で1回あたりのトークン97分の1、記憶はワークスペース単位で他の人に渡せる

出典 ─ Apple Machine Learning Research(Sanjana Pedada, Aditya Dhavala, Neelraj Patil・2026年9月16日・9月18日取得)
Anthropicが7月30日の「Claudeが実在システムに侵入」3件と英AISIのMythos 5の件を受けて何を変えたか──脱出を検知して止める分類器、外部評価者への必須手順、RL環境の1か月凍結で10%超を差し戻し、「報酬ハックで訓練したモデル」が模擬環境でサンドボックスを破る実験。METRに独立レビューを依頼の記事画像
研究09.22読了10分

Anthropicが7月30日の「Claudeが実在システムに侵入」3件と英AISIのMythos 5の件を受けて何を変えたか──脱出を検知して止める分類器、外部評価者への必須手順、RL環境の1か月凍結で10%超を差し戻し、「報酬ハックで訓練したモデル」が模擬環境でサンドボックスを破る実験。METRに独立レビューを依頼

出典 ─ Anthropic(2026年8月31日・9月18日取得)
AIの『忘れさせ方』にも文脈が要る──悪用も正当利用もできる知識を測る『ConceptGuard』ベンチマークの記事画像
研究09.06読了17分

AIの『忘れさせ方』にも文脈が要る──悪用も正当利用もできる知識を測る『ConceptGuard』ベンチマーク

出典 ─ ConceptGuard: Benchmar
「Mechanist」とは何か──AIの中身をAI自身に解剖させたら「安全そうな学習データ」経由の危険な特性伝播が見つかったの記事画像
研究09.06読了11分

「Mechanist」とは何か──AIの中身をAI自身に解剖させたら「安全そうな学習データ」経由の危険な特性伝播が見つかった

出典 ─ Mechanist: AI as a Sci
暗号化された「思考」は使い回せる──推論トレースを盗み出す手口を報告した論文を読むの記事画像
研究09.06読了14分

暗号化された「思考」は使い回せる──推論トレースを盗み出す手口を報告した論文を読む

出典 ─ Stealing Reasoning Tra
AIが生成したデータでAIを学習させ続けると何が起きるか──「モデル崩壊」をNature論文の実例で読むの記事画像
研究09.02読了14分

AIが生成したデータでAIを学習させ続けると何が起きるか──「モデル崩壊」をNature論文の実例で読む

出典 ─ AI models collapse whe