HN415
長文コンテキストを画像へ圧縮!「LensVLM」で関連ページだけを賢く抽出する方法
LensVLM: Compressing long context as images, expanding only relevant pages
victormustar・1日前
LensVLM: Compressing long context as images, expanding only relevant pages
「LensVLM」は、膨大な長文コンテキストを画像として圧縮し、必要なページのみを効率的に抽出・活用するための画期的なアプローチです。大量のデータ処理におけるボトルネックを解消し、よりスマートで軽量なモデル運用を可能にする注目の技術です。
このアプローチすごくいいね!ここのビジョンエンコーダーは、リッチで高精度なRAGエンコーダーみたいなものだって解釈してる。
こういうシステムでやってみたいのは、KVキャッシュの順序に依存しない(つまりページ単位で順序が変わってもいい)モデルにすることかな。要するに、どのページのKVキャッシュでもモデルが理解できるようにすれば、ビジョンエンコーダーが処理したページをモデルが推論するための『チャンク』として扱えるようになるはず。
そうすれば、詳細をズームインして確認するようなテクニックも自然に応用できるようになると思う。
面白いアプローチだね。ありがとう。
おっ、Oh My Piはもうしばらく前からこれやってるよ。Snap compactって呼んでるね。