English →

算力平台模型实测报告

测试对象:ByteHorizon AI Cloud 平台端点(OpenAI 兼容接口) 测试日期:2026-07-13 版本:v1.1(三轮完整版:WiFi 白天 · 热点对照 · WiFi 晚高峰)

一、摘要结论

核验项结果说明
能力测试(16 题标准答案题库) ✅ 通过 三个模型均 16/16 满分(qwen3.5-flash 需充足 token 预算,见 §4.3)
首字延迟 TTFT ✅ 通过 三模型平均 0.78–1.82 秒,均低于 2 秒的优秀线
吞吐速度 ✅ 通过 42.6–51.1 tokens/s,达到 flash 级模型正常水平
5 路并发 ✅ 通过 3 模型 × 5 路全部返回 200,无限流报错
网络链路(三轮对照) ✅ 通过 WiFi 与手机热点两种网络下吞吐差异 <3%,证明瓶颈在服务端侧、数据可信(§5.4)
晚高峰稳定性 ✅ 通过 晚 8 点高峰轮吞吐仅比白天低 3~7%,远好于「不低于白天 60%」的达标线
模型一致性核验 ⚠️ 两项须知 ① kimi-k2.6 为 w4a8 量化部署版(非全精度原版);② qwen3.5-flash 为强制深度思考模式,token 消耗约为 deepseek 的 9.7 倍
一句话结论:三个模型的答题能力无差别(全满分),真正的差别在速度与成本——同样 16 道题,输出 token 消耗为 deepseek-v4-flash 2,997、kimi-k2.6 12,062、qwen3.5-flash 29,117。按 token 计费时,三者单位答案成本约为 1 : 4 : 9.7

二、测试环境

类别参数实测值
硬件测试机标准测试主机(仅发起 API 请求,不参与推理,本机配置不影响结果)
说明API 测试仅发送请求,推理在服务端完成,本机配置不影响结果
软件操作系统macOS 12.7.6 (21H1320)
测试程序Python 3.14.5 + requests 2.34.2(自研脚本,附录 B 可复现)
网络接入方式主测:家用 WiFi(5GHz);对照:手机蜂窝热点(§5.4)
宽带容量WiFi 下行 3.27 Mbps / 上行 15.19 Mbps(macOS networkQuality 实测)
到端点延迟(WiFi)ping 10 包:0% 丢包,平均 33.5ms(最小 15.1 / 最大 85.5)
到端点延迟(热点)ping 10 包:0% 丢包,平均 80.9ms,抖动大(最大 467.5ms)
TLS 建连108–179ms(curl 实测 3 次)
代理/VPN已确认全部关闭(无 clash 内核进程),流量直连
被测端接口本平台 API 端点(OpenAI 兼容)
模型deepseek-v4-flash · kimi-k2.6 · qwen3.5-flash(/v1/models 实测仅此 3 个)
时间测试窗口2026-07-13 19:22–19:45(新加坡时间,工作日晚间)
关于网络对结果的影响:能力得分与网络完全无关(答案对错不受网速影响)。速度指标中网络延迟仅占约 33ms,而模型响应以秒计, 影响低于 5%。宽带下行仅 3.27 Mbps,但 LLM 文字流每秒仅数 KB,带宽远未成为瓶颈。手机热点对照轮与晚高峰轮均已完成(§5.4), 三轮吞吐差异 <8%,验证了本报告数据的稳健性。

三、测试方法

3.1 能力测试(16 题标准答案题库)

3.2 性能测试

四、能力测试结果

4.1 总分

deepseek-v4-flash
16/16
平均 3.8 秒/题 · 187 tokens/题
kimi-k2.6
16/16
平均 13.3 秒/题 · 754 tokens/题
qwen3.5-flash
16/16
复测成绩 · 平均 53.2 秒/题 · 1,820 tokens/题

五个分类(数学/逻辑/代码/中文/指令遵循)三模型均为满分,能力层面无法拉开差距;差距体现在下面的耗时与 token 消耗。

4.2 逐题结果矩阵

题号类别题目(摘要)标准答案 deepseek-v4-flashkimi-k2.6qwen3.5-flash*
math-1数学等差数列前100项和(首项3公差7)34950✅ 5.4s✅ 9.0s✅ 56s
math-2数学2¹⁰⁰ 除以 7 的余数2✅ 5.0s✅ 22.1s✅ 65s
math-3数学1–1000 中能被 3 或 5 整除的个数467✅ 5.3s✅ 12.9s✅ 58s
math-4数学x+y=10, x²+y²=58,求 x³+y³370✅ 4.5s✅ 12.5s✅ 58s
math-5数学·竞赛n²+85n+2017 为完全平方数的正整数 n 之和(AIME)195✅ 13.4s✅ 83.0s✅ 203s
logic-1逻辑5 台机器 5 分钟 5 个零件,100 台做 100 个要几分钟5✅ 3.0s✅ 13.7s✅ 54s
logic-2逻辑妈妈有三个孩子,老大大毛老二二毛,老三叫什么小明✅ 2.2s✅ 4.4s✅ 27s
logic-3逻辑外观数列 1, 11, 21, 1211, 111221 的下一项312211✅ 3.7s✅ 7.7s✅ 42s
code-1代码Python 生成器求和代码的输出18✅ 3.4s✅ 7.7s✅ 45s
code-2代码JavaScript typeof NaN 的输出number✅ 1.7s✅ 7.3s✅ 34s
code-3代码Python 列表引用别名后的长度4✅ 3.7s✅ 7.5s✅ 50s
code-4代码Python 0.1+0.2==0.3 的输出False✅ 3.0s✅ 9.2s✅ 52s
cn-1中文「落霞与孤鹜齐飞」出自哪篇文章滕王阁序✅ 2.5s✅ 4.9s✅ 42s
cn-2中文新加坡的建国总理李光耀✅ 1.6s✅ 4.7s✅ 43s
inst-1指令遵循只输出指定 JSON 对象,无任何多余文字{"name":"test"}✅ 0.8s✅ 3.3s✅ 13s
inst-2指令遵循反转字符串 hello world,只输出结果dlrow olleh✅ 0.9s✅ 2.4s✅ 12s

* qwen3.5-flash 为复测成绩(充足 token 预算 + 流式连接,4 题并发执行,耗时可能略有高估)。deepseek/kimi 为首轮成绩,逐题顺序执行。

4.3 公平性披露:qwen3.5-flash 两轮成绩差异

首轮 3/16 → 复测 16/16。原因不是能力问题:qwen3.5-flash 在该端点强制开启深度思考, 每题先输出数千字思考过程。首轮预算(1,024–2,048 tokens)被思考耗尽,答案被截断判 0 分 (所有失败题的 token 数正好卡在预算上限、正文为空;竞赛题因思考超时触发网关 524 错误)。 复测将预算放宽到 16,384 tokens 并改用流式连接后全部答对。 商用提示:该模型无法用小预算换快答案——预算给小了不是「答得简短」而是「没有答案」,接入方必须预留大 max_tokens。

4.4 平均每题耗时(能力测试实测)

平均每题响应耗时(秒,越短越好)

16 题实测平均值;含模型思考时间。竞赛难题单独看:deepseek 13.4s / kimi 83s / qwen 203s

deepseek-v4-flash deepseek-v4-flash:平均 3.8 秒/题 3.8s kimi-k2.6 kimi-k2.6:平均 13.3 秒/题 13.3s qwen3.5-flash qwen3.5-flash:平均 53.2 秒/题(含强制思考) 53.2s 0 15 30 45 60 秒

五、性能测试结果

5.1 首字延迟 TTFT(用户按下回车到第一个字出现)

首字延迟(秒,越短越好)· 3 次实测取平均

商用参考线:<2s 优秀,2–5s 及格。kimi 首次请求 3.41s 含冷启动,后两次 0.72/1.32s

deepseek-v4-flash deepseek-v4-flash:TTFT 平均 0.88 秒 0.88s kimi-k2.6 kimi-k2.6:TTFT 平均 1.82 秒(含冷启动 3.41s) 1.82s qwen3.5-flash qwen3.5-flash:TTFT 平均 0.78 秒 0.78s 0 0.5 1.0 1.5 2.0 秒

5.2 吞吐速度(生成长文时的出字速度)

吞吐(tokens/秒,越长越好)· 600 字生成任务实测

flash 级模型正常区间 40–100+ tokens/s;低于 20 说明资源池拥挤或被降级

deepseek-v4-flash deepseek-v4-flash:49.3 tokens/s 49.3 kimi-k2.6 kimi-k2.6:51.1 tokens/s 51.1 qwen3.5-flash qwen3.5-flash:42.6 tokens/s 42.6 0 15 30 45 60 tok/s

5.3 并发测试

模型并发路数成功HTTP 状态单路耗时
deepseek-v4-flash55/5全部 2002.2s
kimi-k2.655/5全部 2001.6s
qwen3.5-flash55/5全部 2003.1–3.2s

5.4 三轮网络对照(WiFi 白天 · 手机热点 · WiFi 晚高峰)

轮次(2026-07-13)deepseek-v4-flashkimi-k2.6qwen3.5-flash5并发
TTFT吞吐TTFT吞吐TTFT吞吐
① WiFi 白天 19:440.88s49.31.82s†51.10.78s42.615/15
② 手机热点 20:042.51s‡46.41.23s50.70.77s42.715/15
③ WiFi 晚高峰 20:181.02s45.71.43s50.30.76s43.315/15

吞吐单位 tokens/s。原始数据:results/speed_wifi_20260713-1944.json · speed_hotspot_20260713-2004.json · speed_wifi-night_20260713-2018.json

六、成本效率(按 token 计费视角)

平均每题输出 token 消耗(越短越省钱)· 同一套 16 题

思考型模型的思考过程也按输出 token 计费——能力相同时,token 消耗直接决定单位答案成本

deepseek-v4-flash deepseek-v4-flash:平均 187 tokens/题 187 kimi-k2.6 kimi-k2.6:平均 754 tokens/题 754 qwen3.5-flash qwen3.5-flash:平均 1,820 tokens/题(含强制思考输出) 1,820 0 500 1,000 1,500 2,000 tok
模型16 题总输出 token平均/题相对成本比竞赛难题单题消耗
deepseek-v4-flash2,9971871.0×(基准)821 tok / 13.4s
kimi-k2.612,0627544.0×4,679 tok / 83s
qwen3.5-flash29,1171,8209.7×6,774 tok / 203s

七、后端模型一致性核验

模型接口回显的 model 字段身份自述核验结论
deepseek-v4-flashdeepseek-v4-flash“DeepSeek 最新版模型,由深度求索开发”回显正常,行为特征(极简直答、无思考)与 DeepSeek flash 系一致
kimi-k2.6Kimi-K2.6(w4a8 量化部署)“月之暗面(Moonshot AI)开发的 Kimi”接口回显显示为 w4a8 量化部署版(权重 4bit/激活 8bit 压缩部署),非全精度原版。本次 16 题未见质量损失;本平台已就该量化部署与算力服务方持续跟踪精度表现
qwen3.5-flashQwen3.5-122B“阿里巴巴通义实验室研发的 Qwen3.5”后端为 122B 参数版本;强制思考模式(简单问题也先思考数百 token),暂不可关闭

说明:身份自述可被网关篡改,仅作参考;本报告以「16 题得分是否与该模型公开基准水平相符 + 行为特征 + 后端回显」三重交叉验证。三个模型得分均达到其公开宣称的旗舰水平(参照 Artificial Analysis 2026-07 数据:Kimi K2.6 开源榜第一、DeepSeek V4 系列紧随其后),未发现「挂旗舰名、跑小模型」的以次充好情况。

关于本报告的性质:本报告为 2026-07-13 实测快照。以上核验中发现的事项(如 kimi 为 w4a8 量化部署、qwen 强制思考推高延迟与成本),本平台已第一时间反馈至算力服务方,相关模型参数正在调整优化中。我们对上线模型持续实测与跟踪、发现问题即时闭环,而非一次性采信——这也是我们把实测报告公开给客户的原因。

八、结论与选型建议

使用场景推荐模型理由
客服、翻译、高频问答、Agent 工具调用deepseek-v4-flash速度最快(3.8s/题)、成本最低(1.0×)、指令遵循干脆利落
内容创作、通用对话、综合任务kimi-k2.6能力满分、吞吐最高(51.1 tok/s),成本适中(4.0×);注意为量化部署版
深度推理、数学、复杂分析(不赶时间)qwen3.5-flash推理扎实(竞赛题独立完成),但慢(53s/题)且贵(9.7×),需预留大 token 预算

本平台正在与算力服务方持续跟踪的事项

  1. kimi-k2.6 的 w4a8 量化相对全精度版的基准分数损失数据;
  2. qwen3.5-flash 能否提供关闭/调节思考模式的参数(当前强制思考推高成本与延迟);
  3. 正式的并发/QPS 限额与超限行为(本次 5 并发无限流,但未探到上限);
  4. 各模型上下文长度上限、function calling 支持情况(Agent 类客户必需);
  5. 网关超时策略(实测长推理非流式请求会触发 524,接入方须用流式)。

本报告待补充项

附录 A · 16 道测试题全文与标准答案

题号题目原文标准答案
math-1等差数列首项为3,公差为7,求前100项之和。34950
math-22的100次方除以7,余数是多少?2
math-3从1到1000的整数中,能被3或5整除的有多少个?467
math-4已知 x+y=10, x²+y²=58,求 x³+y³ 的值。370
math-5求所有使得 n²+85n+2017 为完全平方数的正整数 n 之和。(AIME 2017 竞赛题)195
logic-15台机器5分钟能做5个零件,那么100台机器做100个零件需要几分钟?5
logic-2小明的妈妈有三个孩子,老大叫大毛,老二叫二毛,老三叫什么?小明
logic-3数列: 1, 11, 21, 1211, 111221, 下一项是什么?312211
code-1以下Python代码输出什么? print(sum(i for i in range(10) if i % 3 == 0))18
code-2JavaScript中 console.log(typeof NaN) 输出什么?number
code-3以下Python代码输出什么? a=[1,2,3] b=a b.append(4) print(len(a))4
code-4Python中 print(0.1+0.2==0.3) 输出什么?False
cn-1「落霞与孤鹜齐飞,秋水共长天一色」出自哪篇文章?滕王阁序
cn-2新加坡的建国总理是谁?李光耀
inst-1只输出一个JSON对象,包含键"name",值为"test"。不要输出任何其他文字、解释或代码块标记。{"name":"test"}
inst-2把字符串 hello world 整体反转,只输出反转结果,不要任何其他文字。dlrow olleh

除 inst-1/inst-2 外,所有题目末尾均附加统一作答指令:「请一步步思考,最后一行必须只写:答案: <你的最终答案>」。判分程序取最后一个「答案:」行做精确匹配。

附录 B · 原始数据与复现方式