Liquid AIのLFM2.5-2.6B:自分はもっと大きいと思っている2.6Bエージェント
Liquid AIの新しい2.6Bパラメータのハイブリッドモデルは、4倍大きいモデルと競合するエージェント性能を主張し、M5 Maxで220 tok/s、CPUで113 tok/sを達成、すべて2.5 GB未満のメモリで動作します。

Liquid AIは、オンデバイスのエージェントワークロードに焦点を当てた2.6Bパラメータのハイブリッドモデル、LFM2.5-2.6Bをリリースしました。その売りはシンプルです:GPUクラスターを必要とせずに、エージェントレベルのツール使用と指示追従を実現します。このモデルは128Kのコンテキストウィンドウとエージェント向けポストトレーニングを組み合わせており、その数値はもう一度見る価値があります。
仕様とパフォーマンス
このモデルはLFM2アーキテクチャに基づいており、30層(22のダブルゲート短畳み込みブロック+8 GQA)、語彙数128,000、トレーニング予算34兆トークンです。ベトナム語、タイ語、インドネシア語を含む16言語をサポートしています。コンテキスト長は131,072トークンです。
パフォーマンスの主張が見出しです:Apple M5 Maxで毎秒220トークン、AMD Ryzen CPUで毎秒113トークン、すべて2.5 GB未満のメモリで動作します。これは、ラップトップで実際のエージェントループを問題なく実行できる速さです。
エージェント向けポストトレーニング
ポストトレーニングパイプラインは、Liquid AIが興味深い作業を行った部分です。これは4段階のプロセスです:2回の教師ありファインチューニング、ドメイン別教師の特化、マルチドメインのオンポリシー蒸留、そして最後にエージェント強化学習です。RL段階では、人気のあるエージェントハーネス内でモデルをトレーニングし、そのツール、システムプロンプト、相互作用パターンにさらします。これは、エンジニアが実際に使用するエージェントエコシステム全体でモデルを確実に動作させるための意図的な動きです。
このモデルは純粋な推論モデルです—常に回答する前に考え、チャットテンプレートに<think>タグを追加します。ツール使用は4段階のプロトコルに従います:関数をJSONとして定義し、<|tool_call_start|>と<|tool_call_end|>トークンの間でPython構文で呼び出し、実行し、最終回答を生成します。必要に応じてJSONにオーバーライドできます。
デプロイメント形式
Liquid AIはモデルを複数の形式で提供しています:ネイティブ(Transformers、vLLM、SGLang用)、GGUF(llama.cppおよびCPU推論用)、ONNX(クロスプラットフォームおよびエッジ用)、MLX(Apple Silicon用)。これにより、クラウドGPUからMacBook Airまでの全スペクトラムをカバーします。
サポートされる推論フレームワークには、Transformers、vLLM、llama.cpp、MLX、LM Studio、SGLangが含まれます。Transformersでのクイックスタートにはtransformers>=5.0.0が必要です。
対象外の用途
Liquid AIはモデルの限界について明確に述べています:エージェントワークロード、ツール使用、データ抽出、RAG、長文コンテキストワークフローに推奨されますが、エージェントコーディングや知識集約型タスクには推奨されません。これは2.6Bモデルにとって賢明な線引きです。
自分は10Bだと思っている2.6Bモデル—しかもラップトップで220 tok/sで動作。
| 仕様 | 値 |
|---|---|
| パラメータ | 2.69B |
| 層 | 30(22 conv + 8 GQA) |
| トレーニングトークン | 34T |
| コンテキスト長 | 131,072 |
| 言語 | 16 |
| 速度(M5 Max) | 220 tok/s |
| 速度(Ryzen CPU) | 113 tok/s |
| メモリ | < 2.5 GB |
ディスカッション
0 件のコメント
最初のコメントを投稿しましょう。