LOCAL INFERENCE DECISION TOOL
别只问“能不能跑”。
要问跑得值不值。
把模型参数、量化、上下文、内存带宽与整机成本放进同一把尺子。先估容量,再看速度,最后算投入。
01
设定你的部署目标
所有结果会即时重算
选择后会显示模型架构、参数与适用场景
4K模型上限
¥3k¥100k+
02
先看结论,再看参数
速度区间为规划估算
正在计算合适的平台…
03
把候选项放在一条线上
点击平台卡片加入或移出对比
SHORTLIST
平台横向对比
默认展示排名前三的平台
| 平台 | 适配 | 预估速度 | 可用内存 | 带宽 | 整机估价 | 主要瓶颈 |
|---|
READ THE ASSUMPTIONS
这是决策预估,
不是跑分排行榜。
同一块硬件会因框架、驱动、上下文、并发、散热和模型格式产生明显差异。这里的目标是帮你排除不合理组合,并得到值得实测的候选清单。
容量怎么算?
总需求 = 量化权重 + KV Cache + 运行时占用 + 8% 安全边际。MoE 的全部专家权重仍需驻留,因此容量按总参数计算。
速度怎么算?
以单用户 decode 为目标,从内存带宽和后端效率估算,并加入小模型计算上限。MoE 速度按激活参数估算;CPU/系统内存卸载会施加显著惩罚。
价格代表什么?
价格为 2026 年 7 月中国大陆可购整机的规划估价,不是实时报价。显卡平台包含基础主机,专业方案按典型工作站配置估算。
我该如何验证?
锁定 2–3 个候选后,用相同 GGUF/MLX/FP8 模型、相同上下文和相同采样参数实测 prompt 与 decode 速度,再测持续负载功耗和噪声。