LOCAL INFERENCE DECISION TOOL

别只问“能不能跑”。
要问跑得值不值。

把模型参数、量化、上下文、内存带宽与整机成本放进同一把尺子。先估容量,再看速度,最后算投入。

01

设定你的部署目标

所有结果会即时重算

选择后会显示模型架构、参数与适用场景

8K
4K模型上限
¥20,000
¥3k¥100k+
平台范围
02

先看结论,再看参数

速度区间为规划估算

正在计算合适的平台…

正在整理候选平台

舒适 临界 卸载
03

把候选项放在一条线上

点击平台卡片加入或移出对比

SHORTLIST

平台横向对比

默认展示排名前三的平台

平台 适配 预估速度 可用内存 带宽 整机估价 主要瓶颈

READ THE ASSUMPTIONS

这是决策预估,
不是跑分排行榜。

同一块硬件会因框架、驱动、上下文、并发、散热和模型格式产生明显差异。这里的目标是帮你排除不合理组合,并得到值得实测的候选清单。

容量怎么算?

总需求 = 量化权重 + KV Cache + 运行时占用 + 8% 安全边际。MoE 的全部专家权重仍需驻留,因此容量按总参数计算。

速度怎么算?

以单用户 decode 为目标,从内存带宽和后端效率估算,并加入小模型计算上限。MoE 速度按激活参数估算;CPU/系统内存卸载会施加显著惩罚。

价格代表什么?

价格为 2026 年 7 月中国大陆可购整机的规划估价,不是实时报价。显卡平台包含基础主机,专业方案按典型工作站配置估算。

我该如何验证?

锁定 2–3 个候选后,用相同 GGUF/MLX/FP8 模型、相同上下文和相同采样参数实测 prompt 与 decode 速度,再测持续负载功耗和噪声。

官方资料

参数与硬件规格来源