LLM内部の一見「無駄」だと思われていたデータが、実は「意味付け」の基準に役立っていた、という話。
大規模言語モデルの内部を覗いたとき、研究者たちは奇妙な現象に気づきました。
特定の位置だけが異常に大きな数値を持つ。
しかもそれが、ほぼすべての入力で再現される。
最初は「学習の副作用」だと思われていたこの現象が、実は生成AIにとって必要不可欠な仕組みだったという研究が、2026年1月に発表されました。
- A Unified View of Attention and Residual Sinks: Outlier-Driven Rescaling is Essential for Transformer Training(30 Jan 2026)
1. 研究者が見つけた「繰り返される異常」
モデルの内部データを可視化すると、数値の並び(テンソル)がヒートマップとして見えます。
普通なら似たような色が並ぶはずなのに、特定の場所だけが真っ赤に染まっている。

これが「外れ値(outlier)」です。
面白いのは、その外れ値が現れる場所です。文頭トークンや改行のような、意味的にはほとんど重要でない位置に集中していました。研究者たちは最初、これを「意味のないノイズ」だと考えていたようです。
でも、外れ値を強制的に小さくする実験をしたら、モデルの性能が落ちてしまった。
これは予想外でした。
2. 外れ値は「正規化」とセットで働く
ここからが本題です。
Transformerの内部では、数値の大きさを揃える「正規化」という処理が何度も実行されます。数値が大きすぎると計算が暴れるし、小さすぎると差が出ない。だから平均や分散を使ってスケールを調整するんです。
外れ値の役割は、この正規化の効き方をコントロールすることだと分かってきました。
例えば、ベクトルの中に1つだけ突出して大きい成分があると、正規化の計算がその値に引っ張られます。すると他の普通の成分は、相対的に小さく見えるようになる。これが「外れ値駆動の再スケーリング」です。
つまり外れ値は、他の成分の見え方を間接的に調整しているんです。
3. Attention Sinkの正体
もう一つ興味深いのが「attention sink(注意の吸い込み口)」です。
Attentionは、どの単語をどれだけ見るかを決める仕組みで、softmaxという関数を使います。このsoftmaxは最大値にものすごく敏感で、1つでも大きなスコアがあると、そこに注意が集中してしまいます。
研究では、この集中先が意味のないトークン(文頭など)であることが多いと報告されています。
なぜそんな場所に?
答えは「意味を持たせるためではない」からです。attention sinkは、注意の分布に基準点を作ることで、他のトークン同士の注意の強弱を安定させる役割を果たしていると考えられています。学習中に数値が暴れないようにするための、いわば「重り」なんです。
4. 「データ構造を見てたら、あれ?」から始まった
この発見の経緯が個人的には面白いと思いました。
研究者は最初から「外れ値に機能がある」と思っていたわけではありません。単純にテンソルを可視化していたら、「毎回同じ場所に異常値が立つ」という再現性の高さに気づいた。それで詳しく調べてみたら、正規化と連動していることが分かった。
つまり、理論から演繹したというより、データを観察する中で「これ、何だろう?」と思ったのが出発点です。深層学習の研究では、こういう帰納的なアプローチが意外と多いのかもしれません。
5. 量子化との関係
この研究が注目されているもう一つの理由は、量子化(モデルの軽量化)との関連です。
量子化では数値を粗く丸めるので、外れ値があると困ります。外れ値に合わせてスケールを取ると、普通の値の解像度が落ちてしまうからです。
ただし外れ値を単純に削除すると性能が落ちる。だから「外れ値のスケール調整機能だけを残しつつ、数値の偏りを緩和する」という工夫が必要になります。論文では、ゲート付きスケーリングという手法で精度が平均2ポイント向上したと報告されています。
6. モデルが自分で獲得した「部品」
外れ値は設計者が意図的に組み込んだものではありません。学習の過程で、モデルが自ら獲得した仕組みです。
正規化という制約の中で、数値のバランスを保つために外れ値が生まれた。そう考えると、これは生成AIの「脳構造」の一部なんだと捉えています。
人間の脳にも、一見無駄に見えるけれど実は重要な役割を持つ構造があります。外れ値も、そういう「見えにくい必然」の一つなのかもしれません。
深層学習はまだ発展途上で、モデルの内部で何が起きているかは完全には分かっていません。でも、こうして少しずつ「なぜそうなっているのか」が解明されていくのは、やはり面白いことだと思います。