LFM2.5-2.6B 旨在完全在裝置端驅動高效能代理。它支援工具呼叫和多步驟工作流程,同時保持足夠小巧和快速,可在筆記型電腦到手機等日常硬體上運行。這讓開發者能夠隨處部署代理,將資料保留在裝置上以保護隱私,並擴展使用而無需支付雲端推論費用。

LFM2.5-2.6B 是一款頂尖的代理模型,在工具使用、指令遵循和多步驟代理任務方面,其表現可與體積大四倍的模型競爭。它透過代理強化學習進行訓練,在最受歡迎的代理框架中進行,以提高相容性。該模型推論效率高,在 Apple M5 Max 上可達每秒 220 個 token,在 AMD Ryzen CPU 上可達每秒 113 個 token,且記憶體佔用不到 2.5 GB。

我們如何為邊緣裝置打造可靠的代理模型。LFM2.5-2.6B 經過約 34 兆個 token 的預訓練,並在訓練中期將上下文視窗擴展到 128K。後續訓練將基礎模型轉變為代理,分為四個階段:

監督式微調 (SFT):進行兩輪 SFT,重點偏向代理相關資料,例如工具使用、網路搜尋和框架軌跡。教師專業化:為每個領域(數學、程式碼、工具使用等)訓練一個專業教師模型。多領域策略蒸餾 (MOPD):將專業教師模型蒸餾成一個單一的學生模型。代理強化學習 (Agentic RL):在真實的代理框架中執行多輪強化學習,模型在此過程中學習如何在不同工具、系統提示詞和多輪任務環境中協同工作。

代理強化學習的流程將模型最佳化、推論和環境執行分離為不同的組件。訓練引擎負責最佳化模型,而推論引擎則使用最新的策略生成動作。強化學習框架透過啟動推論、收集軌跡和獎勵,並更新模型來協調整個訓練循環。

動作在沙盒服務中執行,其中 Blackbox Harness 託管代理(例如 OpenClaw 或 Hermes Agent),並協調與任務環境的互動。Harness Proxy 讓我們能夠將代理框架視為無需修改的黑盒子,同時透明地捕捉重建和驗證強化學習訓練樣本所需的 token 級軌跡。

基準測試結果。我們在 STEM、指令遵循、工具使用和代理任務方面,將 LFM2.5-2.6B 與體積約為其四倍的模型進行了評估。儘管它是該組中最小的模型,但其表現卻能與其他模型競爭,甚至經常超越它們。

對於您的應用程式而言,LFM2.5-2.6B 的優勢在於指令遵循和工具使用。它在所有指令遵循基準測試中名列前茅,並且在所有工具使用基準測試中也表現最佳,除了 BFCLv4,僅有 9.7B 的 Qwen 略微領先。在代理任務方面,它擊敗了兩個 Gemma 模型,並與 Qwen 模型持平。

在知識方面也處於領先地位,數學方面則表現接近。程式碼是大型模型保持明顯領先的唯一領域,因此在該方面可能需要考慮更大的模型。

CPU 和 GPU 上的推論速度。LFM2.5-2.6B 在推論生態系統中提供首日支援,包括 llama.cpp、MLX、vLLM、SGLang 和 ONNX。由於其高效的 LFM2 架構,LFM2.5-2.6B 是我們測試過最快的模型,在 M5 Max 上解碼速度達到每秒 220 個 token,在 Ryzen AI Max+ 395 上達到每秒 113 個 token。即使在手機上,它也能以每秒 30 個 token 的速度運行高效能代理。

GPU 推論。LFM2.5-2.6B 是其尺寸類別中最快的模型,在高併發下每秒可達到近 15,000 個輸出 token,相當於單一 H100 每天約 13 億個 token。

如何使用 LFM2.5-2.6B。當您需要用於高負載工作量的裝置端代理時,可以選擇 LFM2.5-2.6B。安裝最新版本的 transformers (相容於 transformers>=5.0.0):

```

pip install -U transformers

```

然後載入並運行模型:

```

from transformers import AutoModelForCausalLM, AutoTokenizer

model_id = "LiquidAI/LFM2.5-2.6B"

model = AutoModelForCausalLM.from_pretrained(

model_id,

device_map="auto",

dtype="bfloat16",

# attn_implementation="flash_attention_2" # uncomment on a compatible GPU

)

tokenizer = AutoTokenizer.from_pretrained(model_id)

prompt = "What is C. elegans?"

input_ids = tokenizer.apply_chat_template(

[{"role": "user", "content": prompt}],

add_generation_prompt=True,

return_tensors="pt",

tokenize=True,

).to(model.device)

output = model.generate(

input_ids,

do_sample=True,

temperature=0.2,

top_k=80,

repetition_penalty=1.05,

max_new_tokens=512,

)

print(tokenizer.decode(output[0], skip_special_tokens=False))

```

LFM2.5-2.6B 示範。請查看這個 LFM2.5-2.6B 驅動研究代理的瀏覽器示範。該代理可以幫助您研究特定問題並生成摘要。

開始使用。LFM2.5-2.6B 和 LFM2.5-2.6B-Base 現已在 Hugging Face 上提供。透過 LFM2.5,我們正在實現 AI 隨處運行的願景。這些模型提供:下載:在 Hugging Face 上取得 LFM2.5-2.6B-Base 和 LFM2.5-2.6B。

試用:在您的瀏覽器中運行 WebGPU 示範,無需任何設定。在您的框架中使用:遵循我們的指南,了解如何運行本地代理,例如 OpenClaw、Hermes Agent 和 Pi。我們期待看到您的創作。

引用。請引用此文章為:Liquid AI, "LFM2.5-2.6B: Deploy Agents Everywhere", Liquid AI Blog, Aug 2026。或使用 BibTeX 引用:

```

@article{liquidAI202626B,

author = {Liquid AI},

title = {LFM2.5-2.6B: Deploy Agents Everywhere},

journal = {Liquid AI Blog},

year = {2026},

note = {www.liquid.ai/blog/lfm2-5-2-6b},

}

```