爆速・高効率!注目のAttention新アーキテクチャ「Kimi Linear」を徹底解説
Kimi Linear: An Expressive, Efficient Attention Architecture (2025)
Kimi Linear: An Expressive, Efficient Attention Architecture (2025)
2025年に登場した「Kimi Linear」は、従来のAttention機構の課題を克服した、非常に表現力が高く効率的なアーキテクチャです。Transformerモデルにおける計算コストのボトルネックを解消し、よりスムーズで高速な推論を実現することを目指しています。
(2025年) 9ヶ月前のもので、彼らはちょうどメジャーなモデルリリースをしたばかりだからね
Zhangたちのまたしても傑作だな
Kimiの成功が蒸留攻撃によるものだと信じたいなら、この件は無視することだね
古いけど重要な情報。最近公開されたKimi K3の論文[0]を読むとわかるけど、ここで議論されているKimi Linearがベースになっているんだ。スケールアップして、ネイティブなビジョン機能やRLの改善など、いろいろと追加されているよ。
これを使って社内モデルを作り始めたんだけど、その後にGated Deltanet 2( https://arxiv.org/abs/2605.22791 )が出てきて、表現力が進化したもののように見えた。実際テストしてみると、こっちの方が確実にいい感じ。
この分野の専門家の人に聞きたいんだけど、フロンティアモデルで見られるこの「知能」って、アーキテクチャをスケーリングした時に初めて現れる「創発的な」現象ってことで本当に合ってる?
同じアーキテクチャの100万パラメータのモデルは基本的なパズルすら解けないのに、1兆パラメータになると突然ヤコビ予想の反例を提示できるっていうのは、なんだか不思議じゃないか?
直感に反するよね。僕が知る限り、アルゴリズム開発の基本原則の一つは「複雑な問題の解決策を単なる力技で見つけることはできない」というものだったはず。例えば、単純なソートアルゴリズムは、処理能力をいくら増やしてもQuicksortには勝てない。でも、現代のLLM界隈では、みんな競ってスケールアップさせて、経験的に実験して、同じアルゴリズムやアーキテクチャが解決策にたどり着くことを願っているように見える。
今後の研究を支援するため、KDAカーネルとvLLMの実装をオープンソース化し、事前学習済みおよび指示調整済みのモデルチェックポイントを公開する。
これは最高だな。
長文コンテキストの検索性能(needle in haystack、ruler)で、同サイズのフルアテンションモデルと比べてどうなのか知っている人はいる?効率面での利点は素晴らしいけど、リニアアテンションのハイブリッドモデルって大抵そのあたりでボロが出るからさ。
もしこういう標準的じゃないTransformerが普及したら、Etchedみたいな企業はお手上げになるの?