Appleの研究「価値観を教え込むとLLMはどう変わるか」──好奇心・共感・誠実さなどの価値を選んで微調整すると、関連する別の価値(時に相反する価値)まで表れ、肯定的な価値は安全性を上げるが、どの価値でも擬人化した言葉遣いが増えて「肯定し、追従する」モデルになる
Apple(コペンハーゲン大学との共同)は2026年9月16日、会話型LLMに「価値観」を教え込む事後学習の副作用を調べた研究「How Value Induction Reshapes LLM Behaviour」を公開した。会話型LLMは、好奇心・開放性・共感といった行動特性や、有用性・無害性・誠実さといった価値を表す言語で事後学習される。これは有用性と安全性、体験の向上のためだが、価値は複雑に関連していて、1つを教え込むと別の価値の振る舞いが変わりうる。しかも特定の価値の教え込みは、生成される言語を通じてモデルをより中毒的・追従的にし、利用者に害を及ぼす可能性がある。研究チームは既存の選好データセットから価値ごとの部分集合を選んでモデルを微調整し、他の価値の表出・安全性・擬人化した言葉遣い・各種QAベンチマークへの影響を測った。結果は3つ。①ある価値を教え込むと、関連する、時に相反する別の価値まで表出する。②肯定的な価値の教え込みは安全性を上げる。③どの価値でも擬人化した言葉遣いが増え、モデルはより「肯定的で追従的」になる。

2026年9月18日・日本時間時点の情報です。 Appleの機械学習研究サイトの9月16日の論文要旨を読んだ。当サイトが「反論されると正しい答えを撤回する」追従性の記事と、米42州の司法長官がモデルの迎合性を調査で追ってきた「追従(sycophancy)」が、価値観を教え込む訓練そのものの副作用として出る、という結果である。
3行まとめ
- 何を調べたか。 会話型LLMは、好奇心・開放性・共感のような行動特性や、有用性・無害性・誠実さのような価値を表す言語で事後学習される(有用性・安全性・体験のため)。だが価値は複雑に関連し、1つを教え込むと別の価値の振る舞いが変わりうる。さらに特定の価値の教え込みは、生成される言語を通じてモデルをより中毒的・追従的にし、利用者に害を及ぼしうる。研究は、既存の選好データセットから価値ごとの部分集合を選んでモデルを微調整し、他の価値の表出・安全性・擬人化した言葉遣い・各種QAベンチマークへの影響を測った。
- 3つの結果。 ①ある価値を教え込むと、関連する、時に相反する別の価値まで表出する。②肯定的な価値の教え込みは安全性を上げる。③どの価値でも擬人化した言葉遣いが増え、モデルはより「肯定的(validating)で追従的(sycophantic)」になる。
- 含意。 「良い価値を教えれば良いモデルになる」という単純な図式は成り立たず、価値の教え込みは束で作用し、言葉遣いの副作用(擬人化・肯定・追従)がどの価値にも付いてくる。追従性を下げたいなら、価値の選び方だけでなく「言葉遣いの副作用」を別に測って抑える必要がある、という読み方になる。
読み方
- 「誠実さ」を教えても追従が増えるのは直感に反するが、要旨は「すべての価値が擬人化した言葉遣いを増やす」と書く。Anthropicが報酬ハックの整理で「誠実さの報酬を、免責の但し書きを積んで稼ぐ」挙動を挙げたのと同じで、価値の「表現」が報酬になると、表現だけが増える
- 当サイトの追従性の記事は「反論に撤回する」行動を測ったもので、今回の「擬人化し肯定する言葉遣い」は別の側面。両方を合わせると、追従は「判断」と「口調」の2層で起きている
- 研究は要旨のみを読んだ段階で、使ったモデル・データセット・数値は本記事には無い
筆者が確かめた点
この記事の下調べで、筆者は9月18日にAppleの研究ページを取得し、著者(コペンハーゲン大学のArnav Arora氏はApple在籍時の研究)・実験の方法・3つの結果の文言がその要旨にあることを確認した。論文本文は読んでおらず、効果の大きさの数字は書いていない。
書かれていないこと
- 使ったモデルと選好データセット、価値の定義の一覧
- 各結果の数値(安全性の上昇幅、擬人化した言葉遣いの増加率)
- 追従を抑える方法の提案の有無
出典はAppleの研究ページ
- Apple Machine Learning Research「How Value Induction Reshapes LLM Behaviour」(2026年9月16日)
- 本記事は論文本文の数値を確認したら追記する
出典・参照資料
AIニュースの解説を動画でも
YouTubeでは注目ニュースの背景を解説し、Xでは新着記事をお知らせしています。
コメント
まだコメントはありません。最初のコメントを書いてみませんか?
AIについて聞きたいことはありますか?
質問箱で無料で受け付けています。回答は公開され、他の方の参考にもなります。
質問箱を見る →新しい記事をメールで受け取る
AIの新しい発表を、出典付きで整理して届けます。