3つのポイント
LLaVAにおける物体ハルシネーションは、画像に存在しない物体を生成する現象である。
この現象は、LLaVA-1.5-7Bモデルがキャプション生成時に誤った情報を出力することから生じる。研究では、特定のアテンションヘッドが幻覚の原因であることを特定し、修正の可能性を探った。アテンションヘッドの機能を除去することで、幻覚の発生を抑制できるかどうかを検証した。
今後、他のモデルでも同様のアプローチが採用され、物体ハルシネーションの抑制が進む可能性がある。さらに、生成AIの精度向上に向けた新たな研究が進展することが期待される。
ミドルマンが精査
この論文の読みどころ
幻覚を減らす手法の話に見えて、新しいのは「どこが壊れているか」を32個のアテンションヘッドという具体的な部位まで名指しし、そこだけを狙って直した点です。根拠はLLaVA-1.5-7BとCOCO画像400枚での比較で、CHAIRsが0.370から0.230へ下がったと本文にある一方、対象モデルも枚数も限られ、他の規模や別データでの再現はまだ示されていません。診断してから局所的に手を入れる流れが広がれば、モデル全体を作り直さず壊れた部位だけ交換する修理が普通になっていきます。
✅ AI解説
LLaVAの物体ハルシネーションって、ちょっと面白い現象なんですよ。要するに、AIが画像を見てキャプションを生成する時に、実際には存在しない物体を勝手に作り出しちゃうことを指します。これ、結構ややこしい問題で、最近の研究でその原因が特定の注意ヘッドに絞り込まれたんです。
この研究は、LLaVA-1.5-7Bというビジョン・ランゲージモデルを使って行われました。研究者たちは、AIがどのようにして幻覚的なオブジェクトを生成するのか、その仕組みを解明しようとしたんです。具体的には、幻覚的なオブジェクトの周りでの画像アテンションの低下を観察して、どの注意ヘッドが問題を引き起こしているのかを調べました。
研究では、32のアテンションヘッドを評価して、どのヘッドが幻覚を引き起こしているのかを特定しました。その後、候補となるヘッドを機能除去して、幻覚トークンの確率がどう変わるかを測定したんです。これによって、どのヘッドが問題なのかをさらに深く理解できるようになりました。特に、特定のヘッドが幻覚を引き起こす原因として、画像の情報を正しく処理できていないことが明らかになったんですよ。
さらに、400枚のCOCO画像を使って実験を行い、2つの介入手法を試しました。具体的には、ヘッドスライスされたLoRAアダプターと推論時のグラウンディングコントローラーを使ったんです。これらの手法を組み合わせることで、幻覚的オブジェクトを含むキャプションの割合が大幅に減少したんですよ。具体的には、0.370から0.230に、幻覚的オブジェクトの言及の割合も0.156から0.096に下がったんです。これって、AIの精度向上に直結する重要な成果なんです。
この研究の結果は、生成AIの誤りを理解する上でとても重要なんです。AIがどのようにして間違った情報を生成するのか、そのメカニズムを知ることで、今後の改善策を考える手助けになりますよね。これからも、こうした研究が進むことで、より正確なAIが生まれることを期待したいですね。特に、生成AIの利用が広がる中で、信頼性の高い情報を提供することが求められているので、こうした取り組みはますます重要になってくると思います。

ブッダ
織田信長
吉田松陰
坂本龍馬
太宰治
葛飾北斎
ソクラテス
野口英世
ダヴィンチ
エジソン
アインシュタイン
ナイチンゲール
ガリレオ
ニーチェ