LFM2.5-2.6B 旨在完全在裝置端驅動高效能代理。它支援工具呼叫和多步驟工作流程,同時保持足夠小巧和快速,可在筆記型電腦到手機等日常硬體上運行。這讓開發者能夠隨處部署代理,將資料保留在裝置上以保護隱私,並擴展使用而無需支付雲端推論費用。
LFM2.5-2.6B 是一款頂尖的代理模型,在工具使用、指令遵循和多步驟代理任務方面,其表現可與體積大四倍的模型競爭。它透過代理強化學習進行訓練,在最受歡迎的代理框架中進行,以提高相容性。該模型推論效率高,在 Apple M5 Max 上可達每秒 220 個 token,在 AMD Ryzen CPU 上可達每秒 113 個 token,且記憶體佔用不到 2.5 GB。
我們如何為邊緣裝置打造可靠的代理模型。LFM2.5-2.6B 經過約 34 兆個 token 的預訓練,並在訓練中期將上下文視窗擴展到 128K。後續訓練將基礎模型轉變為代理,分為四個階段:
監督式微調 (SFT):進行兩輪 SFT,重點偏向代理相關資料,例如工具使用、網路搜尋和框架軌跡。教師專業化:為每個領域(數學、程式碼、工具使用等)訓練一個專業教師模型。多領域策略蒸餾 (MOPD):將專業教師模型蒸餾成一個單一的學生模型。代理強化學習 (Agentic RL):在真實的代理框架中執行多輪強化學習,模型在此過程中學習如何在不同工具、系統提示詞和多輪任務環境中協同工作。
代理強化學習的流程將模型最佳化、推論和環境執行分離為不同的組件。訓練引擎負責最佳化模型,而推論引擎則使用最新的策略生成動作。強化學習框架透過啟動推論、收集軌跡和獎勵,並更新模型來協調整個訓練循環。
動作在沙盒服務中執行,其中 Blackbox Harness 託管代理(例如 OpenClaw 或 Hermes Agent),並協調與任務環境的互動。Harness Proxy 讓我們能夠將代理框架視為無需修改的黑盒子,同時透明地捕捉重建和驗證強化學習訓練樣本所需的 token 級軌跡。
基準測試結果。我們在 STEM、指令遵循、工具使用和代理任務方面,將 LFM2.5-2.6B 與體積約為其四倍的模型進行了評估。儘管它是該組中最小的模型,但其表現卻能與其他模型競爭,甚至經常超越它們。
對於您的應用程式而言,LFM2.5-2.6B 的優勢在於指令遵循和工具使用。它在所有指令遵循基準測試中名列前茅,並且在所有工具使用基準測試中也表現最佳,除了 BFCLv4,僅有 9.7B 的 Qwen 略微領先。在代理任務方面,它擊敗了兩個 Gemma 模型,並與 Qwen 模型持平。
在知識方面也處於領先地位,數學方面則表現接近。程式碼是大型模型保持明顯領先的唯一領域,因此在該方面可能需要考慮更大的模型。
CPU 和 GPU 上的推論速度。LFM2.5-2.6B 在推論生態系統中提供首日支援,包括 llama.cpp、MLX、vLLM、SGLang 和 ONNX。由於其高效的 LFM2 架構,LFM2.5-2.6B 是我們測試過最快的模型,在 M5 Max 上解碼速度達到每秒 220 個 token,在 Ryzen AI Max+ 395 上達到每秒 113 個 token。即使在手機上,它也能以每秒 30 個 token 的速度運行高效能代理。
GPU 推論。LFM2.5-2.6B 是其尺寸類別中最快的模型,在高併發下每秒可達到近 15,000 個輸出 token,相當於單一 H100 每天約 13 億個 token。
如何使用 LFM2.5-2.6B。當您需要用於高負載工作量的裝置端代理時,可以選擇 LFM2.5-2.6B。安裝最新版本的 transformers (相容於 transformers>=5.0.0):
```
pip install -U transformers
```
然後載入並運行模型:
```
from transformers import AutoModelForCausalLM, AutoTokenizer
model_id = "LiquidAI/LFM2.5-2.6B"
model = AutoModelForCausalLM.from_pretrained(
model_id,
device_map="auto",
dtype="bfloat16",
# attn_implementation="flash_attention_2" # uncomment on a compatible GPU
)
tokenizer = AutoTokenizer.from_pretrained(model_id)
prompt = "What is C. elegans?"
input_ids = tokenizer.apply_chat_template(
[{"role": "user", "content": prompt}],
add_generation_prompt=True,
return_tensors="pt",
tokenize=True,
).to(model.device)
output = model.generate(
input_ids,
do_sample=True,
temperature=0.2,
top_k=80,
repetition_penalty=1.05,
max_new_tokens=512,
)
print(tokenizer.decode(output[0], skip_special_tokens=False))
```
LFM2.5-2.6B 示範。請查看這個 LFM2.5-2.6B 驅動研究代理的瀏覽器示範。該代理可以幫助您研究特定問題並生成摘要。
開始使用。LFM2.5-2.6B 和 LFM2.5-2.6B-Base 現已在 Hugging Face 上提供。透過 LFM2.5,我們正在實現 AI 隨處運行的願景。這些模型提供:下載:在 Hugging Face 上取得 LFM2.5-2.6B-Base 和 LFM2.5-2.6B。
試用:在您的瀏覽器中運行 WebGPU 示範,無需任何設定。在您的框架中使用:遵循我們的指南,了解如何運行本地代理,例如 OpenClaw、Hermes Agent 和 Pi。我們期待看到您的創作。
引用。請引用此文章為:Liquid AI, "LFM2.5-2.6B: Deploy Agents Everywhere", Liquid AI Blog, Aug 2026。或使用 BibTeX 引用:
```
@article{liquidAI202626B,
author = {Liquid AI},
title = {LFM2.5-2.6B: Deploy Agents Everywhere},
journal = {Liquid AI Blog},
year = {2026},
note = {www.liquid.ai/blog/lfm2-5-2-6b},
}
```
