JA EN
体系推論・高速化
·★ 会員·論文·12分で読めます

論文解説: The Personalization Mirage — LLMは「あなた」を勝手に作り上げ、自己申告は逆を指す

メモリ付きLLMは、ユーザーが一度も言っていない属性をどれだけ「知っている」ことにしてしまうのか。150ペルソナ×6タスク×14万件超の主張を判定したMirageBenchから、全12モデルが35〜49%を過剰推論する実態と、自己申告が控えめなモデルほど実際は捏造が多いという逆転現象を、論文本文に沿って解説する。

対象textタスクinference

The Personalization Mirage: How LLMs Fabricate User Profiles, and Why Self-Monitoring Misleads

一次資料 — この記事の根拠

論文の発表 2026-08-05この解説の公開 2026-08-12同月

The Personalization Mirage: How LLMs Fabricate User ProfilesYushi Sun, Yanjie Zhang, Rui Sheng · 2026-08-05 · v1"arXiv:2608.04570論文ページ·PDF
https://arxiv.org/abs/2608.04570"and Why Self-Monitoring Misleads
原文の要旨(Abstract)を読む

Personalized LLMs with persistent memory are increasingly deployed, yet the faithfulness of their user models remains unexamined. We study over-inference (OI): the phenomenon where LLMs fabricate user attributes beyond what evidence supports. We introduce MirageBench, comprising 150 personas balanced across stereotypical, counter-stereotypical, and neutral profiles, 6 personalization tasks spanning an ``imagination gradient'', a four-way faithfulness taxonomy operationalized by an independent judge (validated against a blind human annotator on 400 claims: Cohen's kappa = 0.863 four-class, kappa = 0.900 binary), and a leaderboard of 12 models across 7 families on 143616 judged claims. We find that over-inference is pervasive: every one of the 12 models over-infers 35%--49% of its claims (cross-model mean 41.6%; claim-weighted 41.8%), with no model in this evaluation escaping it. Most strikingly, we surface a Self-Monitoring Inversion: at the model-selection level, models' self-assessed OI is negatively rank-correlated with their judge-measured OI (rho = -0.60, p = 0.044; exploratory, wide bootstrap CI [-0.90, +0.06], n = 12). The models that report the least over-inference tend to be flagged as fabricating the most, so self-reported confidence is a misleading signal for comparing models, even though within a single model self-audit still ranks that model's own claims moderately well (AUROC 0.58--0.83). We further show that OI is task-dependent (27%--59%) and that, in a multi-turn pilot, inferred attributes accumulate approximately linearly with little revision. MirageBench positions external verification, rather than model self-report, as a more reliable foundation for trustworthy personalization.


3つの事実から「あなたの部屋」まで

初対面の相手に、自分のことを3つだけ話したとします。「ソフトウェアエンジニアです」「先週末ロッククライミングに行きました」「今朝、猫がコーヒーをひっくり返しました」。数日後、その相手があなたについてこう吹聴していたらどうでしょう——「あの人はモダンでミニマルな部屋に住んでいて、旅行は都会より自然派で、たぶん独身で、インディーロックが好き」。ひと言も言っていないのに、です。

論文の冒頭(§1)に置かれたこの比喩は、パーソナライズされたLLMが日常的にやっていることの描写です。ChatGPTのメモリ機能のように会話をまたいでユーザー情報を持ち越す仕組みや、Mem0・MemGPTのようなメモリフレームワークは既に広く使われていますが、論文によれば、これらは共通して「モデルは、自分が知っていること推測していることを区別できる」という前提の上に建っています。この研究が示したのは、その前提が実測レベルで壊れている、ということです。

過剰推論(Over-Inference)とは何か

論文が中心に据える概念は過剰推論(OI: Over-Inference)——「手元の証拠が支える範囲を超えて、ユーザーの属性を主張してしまう」現象です(§1)。よく知られたハルシネーション(世界についての誤った事実)とも、社会的バイアス(集団レベルのステレオタイプ)とも違います。個人について、根拠なく、いかにも「あなたのため」らしい属性をでっち上げる——両者の中間にある、独立した失敗モードだと位置づけられています。

これを測れるようにするため、論文はモデルの出力を主張(claim)単位に分解し、証拠との関係で4分類します(§3):

下の2つ(Stereotype+Fabricated)が過剰推論です。主指標はその割合:

OI Rate(M)=#Stereotype+#Fabricated#Total Claims\mathrm{OI\ Rate}(M)=\frac{\#\mathrm{Stereotype}+\#\mathrm{Fabricated}}{\#\mathrm{Total\ Claims}}
(1)

つまり、モデル MM が生成したユーザーについての全主張のうち、「ステレオタイプで埋めた主張」と「完全に作った主張」が占める割合です。分母は主張の総数、分子はその中の根拠なし2分類の件数——これだけの、割り算1回の指標です。

この構図、機械学習を学んだ人には既視感があるはずです。データ点が3つしかないのに表現力の高いモデルを当てはめると、データが支えていない構造まで「学習」してしまう——過学習と同型の現象が、ユーザープロファイルという場所で起きています。

FIG 1点が少ないのに次数を上げると、データが支持しない形をモデルが勝手に作る。「3つの事実」から15属性のプロファイルを埋めるLLMで起きているのは、これと同じ構図

MirageBench: 測るための舞台装置

測定には、証拠が薄く(推測したくなるが、確実にはできない状況)、タスクが現実的で、判定がテスト対象モデルに依存しない仕掛けが要ります。論文のベンチマーク MirageBench の構成(§4):

パイプラインは3段+1で、明示的に「何が推論できるか」を聞くProbe、実タスクをやらせて自己監査もさせるTask、外部判定のJudge、そして8ラウンドの継続対話で記憶の成長を追うAccumです(§4.3)。

リーダーボード(§5.1, Table 1)の中心的な発見は簡潔です。12モデル全てが、パーソナライズされた主張の35〜49%を過剰推論していた。モデル横断の平均は41.6%(件数加重で41.8%)。最良のGemini-3.1-pro(35.1%)とClaude-Opus-4-6(35.4%)でも3分の1を超え、最も高いQwen3-8Bは48.7%に達します。

この先にあるもの

§

ここから先は会員限定です

解説記事371本・教科書26章・学生モード48単元・論文精読6本が、月額¥490ですべて読み放題になります。新しい解説は毎日3本ずつ増えます。いつでも解約でき、解約後も期間の終わりまで読めます。

会員の方はログインすると続きが表示されます

参考文献

  1. Yushi Sun, Yanjie Zhang, Rui Sheng. (2026-08-05) The Personalization Mirage: How LLMs Fabricate User Profiles. "arXiv:2608.04570論文ページ·PDF
  2. https://arxiv.org/abs/2608.04570". and Why Self-Monitoring Misleads

本記事は上記論文の本文にもとづいて執筆しています。数値・主張は原典を優先してください。

コメント

コメントにはログインが必要です