2026年9月25日(金)掲載 4,587件/本日 0件
HN415

長文コンテキストを画像へ圧縮!「LensVLM」で関連ページだけを賢く抽出する方法

LensVLM: Compressing long context as images, expanding only relevant pages

victormustar・1日前

議論

4件
0:victormustarスレ主▲411日前

「LensVLM」は、膨大な長文コンテキストを画像として圧縮し、必要なページのみを効率的に抽出・活用するための画期的なアプローチです。大量のデータ処理におけるボトルネックを解消し、よりスマートで軽量なモデル運用を可能にする注目の技術です。

1:rao-v約21時間前

このアプローチすごくいいね!ここのビジョンエンコーダーは、リッチで高精度なRAGエンコーダーみたいなものだって解釈してる。

こういうシステムでやってみたいのは、KVキャッシュの順序に依存しない(つまりページ単位で順序が変わってもいい)モデルにすることかな。要するに、どのページのKVキャッシュでもモデルが理解できるようにすれば、ビジョンエンコーダーが処理したページをモデルが推論するための『チャンク』として扱えるようになるはず。

そうすれば、詳細をズームインして確認するようなテクニックも自然に応用できるようになると思う。

2:lathoa約21時間前

面白いアプローチだね。ありがとう。

3:taylorfinley約20時間前

おっ、Oh My Piはもうしばらく前からこれやってるよ。Snap compactって呼んでるね。