開源模型觀察 · 研究筆記

MiniCPM5-1B:一顆放棄自訂架構、換來「哪裡都能跑」的 1B 模型

清華 THUNLP / OpenBMB 的第五代 MiniCPM,把重心從「秀肌肉的自訂核心」轉向部署普及率與 agentic 能力。 跑分數字亮眼,社群反應則偏「工程師在認真把玩」,還沒到爆紅程度。

01

這是什麼:一顆刻意「不炫技」的 1B 模型

OpenBMB(清華 THUNLP 實驗室 / 商業化團隊 ModelBest)推出的第五代 MiniCPM,重點不是新架構,而是「標準架構 + 更會推理」。

開發團隊
OpenBMB(清華 THUNLP / ModelBest)
參數量
10.8 億(密集,非 MoE)
架構
標準 LlamaForCausalLM,24 層,GQA 16Q/2KV
上下文長度
128K tokens
授權
Apache 2.0
精度版本
BF16 / FP16 / INT8 / INT4

訓練走三階段(base → mid-training → post-training),後訓練用了 2,000 億 token 的 SFT 資料(含「深度思考」與「混合思考」兩種資料型態), 再疊加針對數學/程式的領域教師模型 RL,以及 On-Policy Distillation(OPD)。OpenBMB 宣稱這套組合讓數學與程式碼平均分數 提升 16 分,同時把「回答過長」的比例降低 29 個百分點。

跟上一代最大的不同,是「退回」標準架構。MiniCPM4 用了自訂的可訓練稀疏注意力核心(InfLLM v2)換取邊緣裝置上的推論加速, 但代價是需要專門的推論引擎支援才能跑。MiniCPM5 反其道而行,改回標準 Llama 架構——換來的是 vLLM、SGLang、llama.cpp、Ollama、MLX 幾乎可以「當天」直接載入,不必等社群或官方額外適配。
02

世代脈絡:每一代都在換一個「以小博大」的說法

MiniCPM 系列從第一代就是「證明小模型也能打」的路線,只是每一代選擇的戰場不同。

世代時間主打賣點
1.0 / 2.020242B 模型號稱打平 Mistral-7B、贏過 Llama2-13B / Falcon-40B(部分測項)
3.02024-094B 模型號稱 GPT-3.5-Turbo 等級,可與 Llama-3.1-8B-Instruct 一戰
4.02025-06自訂可訓練稀疏注意力(InfLLM v2),邊緣晶片生成速度號稱提升 5 倍
4.12025-09單一權重同時支援「快速助理」與「深度推理」雙模式,推理模式解碼再快 3 倍
5 / 5-1B~2026 中退回標準架構求部署普及,重壓 RL + OPD 換取 agentic / 推理能力

OpenBMB 自己的說法是:在涵蓋推理、知識、程式碼、指令遵循、數學、邏輯、agentic 能力的綜合測項上,MiniCPM5-1B 平均分 42.57, 對比同量級(2B 以下)其他開源模型最高分 35.61。第三方獨立評測機構 Artificial Analysis 也給出類似結論—— Intelligence Index 17.9,是所有 ≤1B 參數開源模型中最高分,甚至贏過參數量兩倍以上的 Qwen3.5-2B(約 16.3)。

03

跑分怎麼看:亮眼,但要對齊該比的對象

同級最強,不代表萬能——跟大十倍以上的模型比,該輸還是輸。

對比模型AA Intelligence Index備註
MiniCPM5-1B17.9≤1B 開源模型最高分
Qwen3.5-2B(推理模式)~16.3參數量約 2 倍
Qwen3.5-0.8B(推理模式)10.5相近參數量級
MiniCPM-V 4.6(1.3B,前代)12.7參數量比 5-1B 還多 23%

值得一提的細節:MiniCPM5-1B 在評測中只用了 1,260 萬 output token,比 Qwen3.5-2B(推理模式,3.89 億 token)少了約 31 倍—— 代表它「話比較少」,推理過程更省 token,只是這也比自己上一代少了約 2.3 倍的效率增益,不算全面碾壓。 另外在幻覺測試(AA-Omniscience)上,MiniCPM5-1B 拿到 -1 分,原因是它傾向對不確定的問題選擇「不回答」而非硬猜—— Artificial Analysis 把這解讀為「誠實」而非缺陷,但也代表這顆模型會比較常說「我不知道」。

沒有找到的東西:官方沒有公布跟 Phi、SmolLM、Llama-3.2-1B 直接對照的傳統 MMLU/GSM8K/HumanEval 表格, 「同級最強」目前主要是 OpenBMB 自家說法 + Artificial Analysis 這一個第三方綜合指標佐證,還稱不上被廣泛驗證的共識。 跟大模型(如 Qwen3.6-35B-A3B)比較時,數學(33.1 vs 88.2)、MMLU-Pro(48.9% vs 85.2%)差距明顯——這是預期中的結果, OpenBMB 也沒有宣稱要贏過參數量大 30 倍的模型。
04

部署現況:主流工具第一天就能用

這正是「退回標準架構」換來的實際好處。

Transformers / vLLM / SGLang(原生) GGUF → llama.cpp / Ollama / LM Studio MLX(Apple Silicon,含 4-bit) FlagOS(9 種晶片平台,含非 Nvidia)

量化版本涵蓋從 GPU/高階筆電(FP16,約 2GB,號稱「零品質損失」)、一般筆電/邊緣裝置(INT8,約 1GB,「近乎零損失」), 到手機/平板/車機(INT4,約 0.5GB)的完整階梯。HuggingFace 上已有 Demo Space 可直接試用, 社群也已經有人拿它做 Q8_0 GGUF 微調(針對 agentic 程式碼任務),以及本地桌寵、智慧家庭控制框架等真實專案。

05

社群怎麼說:沒有爆紅,但工程師在認真把玩

綜合 Hacker News、HuggingFace Discussions、X/Twitter 的訊號,整體偏正面,沒有明顯負評聲浪。

Hacker News能見度低

沒有形成獨立的熱門討論串,相關的舊 MiniCPM 討論多半是別的世代(如過去 Llama3V「疑似抄襲 MiniCPM」的爭議),跟這次發表無關。

HF Discussions工程師在把玩

有人做了 Hindi 微調版並上傳量化模型,有人在要求開源 RL 訓練資料,有人在對照 AIME26 成績自行驗證數學推理宣稱。

HF Discussions評測文化砲轟

一則討論串標題是「我們真的該停止用選擇題做評測」——不過砲口對準的是整個業界的評測方法,不是針對這顆模型本身。

X / Twitter偏正面

Artificial Analysis 公開推文肯定其在 Pareto 前緣的位置;其他帳號稱讚 Think/No-Think 切換模式、Apache 2.0 授權, 以及從 2GB 到 0.5GB 的完整量化階梯。

GitHub真實專案落地

社群專案 Katehuuh/MiniCPM5-1B-Agent:以 MiniCPM5-1B 全量微調、Q8_0 GGUF 跑在 llama.cpp 上的 「純 CPU agentic 程式碼助理」,出自一場駭客松。

HF Discussions小抱怨

base model 連結跟技術報告連結一度失效,算是新模型上線常見的文件小疏漏,不是實質性的負評。

整體判讀:反應是「模式派、非病毒式」——沒有引爆話題,但吸引到真正會動手測試、微調、拿去做專案的使用者, 也沒有出現授權爭議或明顯的跑分造假質疑(幻覺測試上的「拒答」行為反而被解讀成優點)。對一個 1B 模型來說, 這種「安靜但扎實」的接受度,比短暫的話題熱度更能反映長期會不會被實際採用。