這是什麼:一顆刻意「不炫技」的 1B 模型
OpenBMB(清華 THUNLP 實驗室 / 商業化團隊 ModelBest)推出的第五代 MiniCPM,重點不是新架構,而是「標準架構 + 更會推理」。
訓練走三階段(base → mid-training → post-training),後訓練用了 2,000 億 token 的 SFT 資料(含「深度思考」與「混合思考」兩種資料型態), 再疊加針對數學/程式的領域教師模型 RL,以及 On-Policy Distillation(OPD)。OpenBMB 宣稱這套組合讓數學與程式碼平均分數 提升 16 分,同時把「回答過長」的比例降低 29 個百分點。
世代脈絡:每一代都在換一個「以小博大」的說法
MiniCPM 系列從第一代就是「證明小模型也能打」的路線,只是每一代選擇的戰場不同。
| 世代 | 時間 | 主打賣點 |
|---|---|---|
| 1.0 / 2.0 | 2024 | 2B 模型號稱打平 Mistral-7B、贏過 Llama2-13B / Falcon-40B(部分測項) |
| 3.0 | 2024-09 | 4B 模型號稱 GPT-3.5-Turbo 等級,可與 Llama-3.1-8B-Instruct 一戰 |
| 4.0 | 2025-06 | 自訂可訓練稀疏注意力(InfLLM v2),邊緣晶片生成速度號稱提升 5 倍 |
| 4.1 | 2025-09 | 單一權重同時支援「快速助理」與「深度推理」雙模式,推理模式解碼再快 3 倍 |
| 5 / 5-1B | ~2026 中 | 退回標準架構求部署普及,重壓 RL + OPD 換取 agentic / 推理能力 |
OpenBMB 自己的說法是:在涵蓋推理、知識、程式碼、指令遵循、數學、邏輯、agentic 能力的綜合測項上,MiniCPM5-1B 平均分 42.57, 對比同量級(2B 以下)其他開源模型最高分 35.61。第三方獨立評測機構 Artificial Analysis 也給出類似結論—— Intelligence Index 17.9,是所有 ≤1B 參數開源模型中最高分,甚至贏過參數量兩倍以上的 Qwen3.5-2B(約 16.3)。
跑分怎麼看:亮眼,但要對齊該比的對象
同級最強,不代表萬能——跟大十倍以上的模型比,該輸還是輸。
| 對比模型 | AA Intelligence Index | 備註 |
|---|---|---|
| MiniCPM5-1B | 17.9 | ≤1B 開源模型最高分 |
| Qwen3.5-2B(推理模式) | ~16.3 | 參數量約 2 倍 |
| Qwen3.5-0.8B(推理模式) | 10.5 | 相近參數量級 |
| MiniCPM-V 4.6(1.3B,前代) | 12.7 | 參數量比 5-1B 還多 23% |
值得一提的細節:MiniCPM5-1B 在評測中只用了 1,260 萬 output token,比 Qwen3.5-2B(推理模式,3.89 億 token)少了約 31 倍—— 代表它「話比較少」,推理過程更省 token,只是這也比自己上一代少了約 2.3 倍的效率增益,不算全面碾壓。 另外在幻覺測試(AA-Omniscience)上,MiniCPM5-1B 拿到 -1 分,原因是它傾向對不確定的問題選擇「不回答」而非硬猜—— Artificial Analysis 把這解讀為「誠實」而非缺陷,但也代表這顆模型會比較常說「我不知道」。
部署現況:主流工具第一天就能用
這正是「退回標準架構」換來的實際好處。
量化版本涵蓋從 GPU/高階筆電(FP16,約 2GB,號稱「零品質損失」)、一般筆電/邊緣裝置(INT8,約 1GB,「近乎零損失」), 到手機/平板/車機(INT4,約 0.5GB)的完整階梯。HuggingFace 上已有 Demo Space 可直接試用, 社群也已經有人拿它做 Q8_0 GGUF 微調(針對 agentic 程式碼任務),以及本地桌寵、智慧家庭控制框架等真實專案。
社群怎麼說:沒有爆紅,但工程師在認真把玩
綜合 Hacker News、HuggingFace Discussions、X/Twitter 的訊號,整體偏正面,沒有明顯負評聲浪。
沒有形成獨立的熱門討論串,相關的舊 MiniCPM 討論多半是別的世代(如過去 Llama3V「疑似抄襲 MiniCPM」的爭議),跟這次發表無關。
有人做了 Hindi 微調版並上傳量化模型,有人在要求開源 RL 訓練資料,有人在對照 AIME26 成績自行驗證數學推理宣稱。
一則討論串標題是「我們真的該停止用選擇題做評測」——不過砲口對準的是整個業界的評測方法,不是針對這顆模型本身。
Artificial Analysis 公開推文肯定其在 Pareto 前緣的位置;其他帳號稱讚 Think/No-Think 切換模式、Apache 2.0 授權, 以及從 2GB 到 0.5GB 的完整量化階梯。
社群專案 Katehuuh/MiniCPM5-1B-Agent:以 MiniCPM5-1B 全量微調、Q8_0 GGUF 跑在 llama.cpp 上的
「純 CPU agentic 程式碼助理」,出自一場駭客松。
base model 連結跟技術報告連結一度失效,算是新模型上線常見的文件小疏漏,不是實質性的負評。