🙆♀️
CALM!超速報版! (改変するつもり>改変途中)
話すこと
- 昨晩気になる記事の投稿みて、夜中にCALMというAIの記事読み始めた。
- なんかいろんな要素からんでいて面白い!
- 残念な点もあったがおもろいこと考えたので
- 今朝論文斜め読みした。速報的に今の理解、考えで書く!
- ちゃんと読み始めたら違うところとか面白い発見たくさん 超速報はやめる
1. どんなもの?
- 複数tokenを一度に予測することで、速く安くLLMを作れるモデル!
- 複数tokenを一回で扱う分最大コンテキスト長が増える
- 複数トーケンの空間の頑健性あげるため、VAE,dropout,KLクリッピング(標準正規分布になるのふせぐみたいで次元毎に下限に制限しているみたい)使っている
- ソフトマックスをargmaxへ。Energy-Based Transformers(自分も記事書いてる)使ってloss値計算
>追記 とおもったら、単にラベルベクターとの距離計算かも?+多様になるよう正則(バッチで?)なんでenegyってことばつかっているんだろ? Energy-Based Transformers使ってもいいとおもった。もっとほかもできそう。複数生成してそのなかの素積元回数(最低限数でてきた)に重み付けてサンプルしているみたい。 - 以下全体図 headにノイズいれて多様性とか制御している模様 >追記(図から思ったけど違う?)
headにプラスしてトークン埋め込みにもノイズorマスクいれているみたい - 入力は、まずtoken埋め込みにして、それをencoreder部分(だよね)でまとめたものを既存のtransformer部分にいれて、最後の潜在空間をhead,decorderに渡してる。
- BrierLMって指標で評価している(この人たちが作った?)既存のでも評価できるとは思ったが。
- 微妙な感じするが、flopsに対して精度良さそう
2. 一部共通点があると思ったモデル
- 拡散言語モデル(自分も記事書いてる)
- Metaの複数token予測
- 文字tokenLLM(圧縮が似ている)(自分もスクラップ書いてる)
- deepseekOCR(画像で圧縮)(記事書く予定)
- 最近の小さいloop系なかで潜在空間を書き換えてるもの(微妙)(自分も記事書いてる)
3. 思ったこと
- Deepseek OCR見た少しあとで、なんで画像で圧縮率高いの話題がでたあとに、そもそもトーケンベクトル圧縮すればいいじゃん?と思ってた。もう限界だった。1/kならできたってことかな?
- 結局、いまのところトークンに縛られている。"アイデアを考える"はもっといい方法ある(考えた。ここでは話さない)
- deepseek ocrみたいにまとまった単位で圧縮復元させてもおもしろそう
- そもそもtoken vectorをもう少し小さいサイズで埋め込めないかの研究しても面白そう
- 空間あまっているなら、そこになにか?情報をうまくおけるの考えてもいい?
- 学習時argmax処理消したい!
あとがき
記事よかったら、いいね♡ 押してね!フォローも嬉しい!
Discussion