76.7 tok/s实测结果 · 单流生成速度
256K配置能力 · 上下文窗口上限
121GB测试环境 · Unified Memory
- 测试目标
- 验证 35B 参数级别模型在桌面级 AI 服务器上,能否满足单人知识库问答对响应速度的要求,作为后续私有化方案的性能基线。
- 测试环境
- 桌面级 AI 服务器;121GB 统一内存(Unified Memory);35B 参数模型。推理框架与量化方式以测试记录为准,本页不补写未确认信息。
- 测试条件
- 单流(单用户串行请求)。未做多人并发压测;输入与输出长度、测试次数等参数未在本页列出。
- 实测结果
- 76.7 tok/s 单流生成速度。该数字是上述特定配置下的结果,不是通用承诺。
- 配置能力
- 256K 上下文为模型与配置支持的上限,说明可加载的上下文规模;不代表 76.7 tok/s 是在 256K 满上下文条件下的实测速度。
- 使用边界
- 单流结果不代表多人并发表现;不同模型、量化与推理框架性能不同;长上下文下速度可能明显下降;客户环境需基于真实硬件与场景单独测试。