| 核验项 | 结果 | 说明 |
|---|---|---|
| 能力测试(16 题标准答案题库) | ✅ 通过 | 三个模型均 16/16 满分(qwen3.5-flash 需充足 token 预算,见 §4.3) |
| 首字延迟 TTFT | ✅ 通过 | 三模型平均 0.78–1.82 秒,均低于 2 秒的优秀线 |
| 吞吐速度 | ✅ 通过 | 42.6–51.1 tokens/s,达到 flash 级模型正常水平 |
| 5 路并发 | ✅ 通过 | 3 模型 × 5 路全部返回 200,无限流报错 |
| 网络链路(三轮对照) | ✅ 通过 | WiFi 与手机热点两种网络下吞吐差异 <3%,证明瓶颈在服务端侧、数据可信(§5.4) |
| 晚高峰稳定性 | ✅ 通过 | 晚 8 点高峰轮吞吐仅比白天低 3~7%,远好于「不低于白天 60%」的达标线 |
| 模型一致性核验 | ⚠️ 两项须知 | ① kimi-k2.6 为 w4a8 量化部署版(非全精度原版);② qwen3.5-flash 为强制深度思考模式,token 消耗约为 deepseek 的 9.7 倍 |
| 类别 | 参数 | 实测值 |
|---|---|---|
| 硬件 | 测试机 | 标准测试主机(仅发起 API 请求,不参与推理,本机配置不影响结果) |
| 说明 | API 测试仅发送请求,推理在服务端完成,本机配置不影响结果 | |
| 软件 | 操作系统 | macOS 12.7.6 (21H1320) |
| 测试程序 | Python 3.14.5 + requests 2.34.2(自研脚本,附录 B 可复现) | |
| 网络 | 接入方式 | 主测:家用 WiFi(5GHz);对照:手机蜂窝热点(§5.4) |
| 宽带容量 | WiFi 下行 3.27 Mbps / 上行 15.19 Mbps(macOS networkQuality 实测) | |
| 到端点延迟(WiFi) | ping 10 包:0% 丢包,平均 33.5ms(最小 15.1 / 最大 85.5) | |
| 到端点延迟(热点) | ping 10 包:0% 丢包,平均 80.9ms,抖动大(最大 467.5ms) | |
| TLS 建连 | 108–179ms(curl 实测 3 次) | |
| 代理/VPN | 已确认全部关闭(无 clash 内核进程),流量直连 | |
| 被测端 | 接口 | 本平台 API 端点(OpenAI 兼容) |
| 模型 | deepseek-v4-flash · kimi-k2.6 · qwen3.5-flash(/v1/models 实测仅此 3 个) | |
| 时间 | 测试窗口 | 2026-07-13 19:22–19:45(新加坡时间,工作日晚间) |
五个分类(数学/逻辑/代码/中文/指令遵循)三模型均为满分,能力层面无法拉开差距;差距体现在下面的耗时与 token 消耗。
| 题号 | 类别 | 题目(摘要) | 标准答案 | deepseek-v4-flash | kimi-k2.6 | qwen3.5-flash* |
|---|---|---|---|---|---|---|
| math-1 | 数学 | 等差数列前100项和(首项3公差7) | 34950 | ✅ 5.4s | ✅ 9.0s | ✅ 56s |
| math-2 | 数学 | 2¹⁰⁰ 除以 7 的余数 | 2 | ✅ 5.0s | ✅ 22.1s | ✅ 65s |
| math-3 | 数学 | 1–1000 中能被 3 或 5 整除的个数 | 467 | ✅ 5.3s | ✅ 12.9s | ✅ 58s |
| math-4 | 数学 | x+y=10, x²+y²=58,求 x³+y³ | 370 | ✅ 4.5s | ✅ 12.5s | ✅ 58s |
| math-5 | 数学·竞赛 | n²+85n+2017 为完全平方数的正整数 n 之和(AIME) | 195 | ✅ 13.4s | ✅ 83.0s | ✅ 203s |
| logic-1 | 逻辑 | 5 台机器 5 分钟 5 个零件,100 台做 100 个要几分钟 | 5 | ✅ 3.0s | ✅ 13.7s | ✅ 54s |
| logic-2 | 逻辑 | 妈妈有三个孩子,老大大毛老二二毛,老三叫什么 | 小明 | ✅ 2.2s | ✅ 4.4s | ✅ 27s |
| logic-3 | 逻辑 | 外观数列 1, 11, 21, 1211, 111221 的下一项 | 312211 | ✅ 3.7s | ✅ 7.7s | ✅ 42s |
| code-1 | 代码 | Python 生成器求和代码的输出 | 18 | ✅ 3.4s | ✅ 7.7s | ✅ 45s |
| code-2 | 代码 | JavaScript typeof NaN 的输出 | number | ✅ 1.7s | ✅ 7.3s | ✅ 34s |
| code-3 | 代码 | Python 列表引用别名后的长度 | 4 | ✅ 3.7s | ✅ 7.5s | ✅ 50s |
| code-4 | 代码 | Python 0.1+0.2==0.3 的输出 | False | ✅ 3.0s | ✅ 9.2s | ✅ 52s |
| cn-1 | 中文 | 「落霞与孤鹜齐飞」出自哪篇文章 | 滕王阁序 | ✅ 2.5s | ✅ 4.9s | ✅ 42s |
| cn-2 | 中文 | 新加坡的建国总理 | 李光耀 | ✅ 1.6s | ✅ 4.7s | ✅ 43s |
| inst-1 | 指令遵循 | 只输出指定 JSON 对象,无任何多余文字 | {"name":"test"} | ✅ 0.8s | ✅ 3.3s | ✅ 13s |
| inst-2 | 指令遵循 | 反转字符串 hello world,只输出结果 | dlrow olleh | ✅ 0.9s | ✅ 2.4s | ✅ 12s |
* qwen3.5-flash 为复测成绩(充足 token 预算 + 流式连接,4 题并发执行,耗时可能略有高估)。deepseek/kimi 为首轮成绩,逐题顺序执行。
16 题实测平均值;含模型思考时间。竞赛难题单独看:deepseek 13.4s / kimi 83s / qwen 203s
商用参考线:<2s 优秀,2–5s 及格。kimi 首次请求 3.41s 含冷启动,后两次 0.72/1.32s
flash 级模型正常区间 40–100+ tokens/s;低于 20 说明资源池拥挤或被降级
| 模型 | 并发路数 | 成功 | HTTP 状态 | 单路耗时 |
|---|---|---|---|---|
| deepseek-v4-flash | 5 | 5/5 | 全部 200 | 2.2s |
| kimi-k2.6 | 5 | 5/5 | 全部 200 | 1.6s |
| qwen3.5-flash | 5 | 5/5 | 全部 200 | 3.1–3.2s |
| 轮次(2026-07-13) | deepseek-v4-flash | kimi-k2.6 | qwen3.5-flash | 5并发 | |||
|---|---|---|---|---|---|---|---|
| TTFT | 吞吐 | TTFT | 吞吐 | TTFT | 吞吐 | ||
| ① WiFi 白天 19:44 | 0.88s | 49.3 | 1.82s† | 51.1 | 0.78s | 42.6 | 15/15 |
| ② 手机热点 20:04 | 2.51s‡ | 46.4 | 1.23s | 50.7 | 0.77s | 42.7 | 15/15 |
| ③ WiFi 晚高峰 20:18 | 1.02s | 45.7 | 1.43s | 50.3 | 0.76s | 43.3 | 15/15 |
吞吐单位 tokens/s。原始数据:results/speed_wifi_20260713-1944.json · speed_hotspot_20260713-2004.json · speed_wifi-night_20260713-2018.json
思考型模型的思考过程也按输出 token 计费——能力相同时,token 消耗直接决定单位答案成本
| 模型 | 16 题总输出 token | 平均/题 | 相对成本比 | 竞赛难题单题消耗 |
|---|---|---|---|---|
| deepseek-v4-flash | 2,997 | 187 | 1.0×(基准) | 821 tok / 13.4s |
| kimi-k2.6 | 12,062 | 754 | 4.0× | 4,679 tok / 83s |
| qwen3.5-flash | 29,117 | 1,820 | 9.7× | 6,774 tok / 203s |
| 模型 | 接口回显的 model 字段 | 身份自述 | 核验结论 |
|---|---|---|---|
| deepseek-v4-flash | deepseek-v4-flash | “DeepSeek 最新版模型,由深度求索开发” | 回显正常,行为特征(极简直答、无思考)与 DeepSeek flash 系一致 |
| kimi-k2.6 | Kimi-K2.6(w4a8 量化部署) | “月之暗面(Moonshot AI)开发的 Kimi” | 接口回显显示为 w4a8 量化部署版(权重 4bit/激活 8bit 压缩部署),非全精度原版。本次 16 题未见质量损失;本平台已就该量化部署与算力服务方持续跟踪精度表现 |
| qwen3.5-flash | Qwen3.5-122B | “阿里巴巴通义实验室研发的 Qwen3.5” | 后端为 122B 参数版本;强制思考模式(简单问题也先思考数百 token),暂不可关闭 |
说明:身份自述可被网关篡改,仅作参考;本报告以「16 题得分是否与该模型公开基准水平相符 + 行为特征 + 后端回显」三重交叉验证。三个模型得分均达到其公开宣称的旗舰水平(参照 Artificial Analysis 2026-07 数据:Kimi K2.6 开源榜第一、DeepSeek V4 系列紧随其后),未发现「挂旗舰名、跑小模型」的以次充好情况。
| 使用场景 | 推荐模型 | 理由 |
|---|---|---|
| 客服、翻译、高频问答、Agent 工具调用 | deepseek-v4-flash | 速度最快(3.8s/题)、成本最低(1.0×)、指令遵循干脆利落 |
| 内容创作、通用对话、综合任务 | kimi-k2.6 | 能力满分、吞吐最高(51.1 tok/s),成本适中(4.0×);注意为量化部署版 |
| 深度推理、数学、复杂分析(不赶时间) | qwen3.5-flash | 推理扎实(竞赛题独立完成),但慢(53s/题)且贵(9.7×),需预留大 token 预算 |
| 题号 | 题目原文 | 标准答案 |
|---|---|---|
| math-1 | 等差数列首项为3,公差为7,求前100项之和。 | 34950 |
| math-2 | 2的100次方除以7,余数是多少? | 2 |
| math-3 | 从1到1000的整数中,能被3或5整除的有多少个? | 467 |
| math-4 | 已知 x+y=10, x²+y²=58,求 x³+y³ 的值。 | 370 |
| math-5 | 求所有使得 n²+85n+2017 为完全平方数的正整数 n 之和。(AIME 2017 竞赛题) | 195 |
| logic-1 | 5台机器5分钟能做5个零件,那么100台机器做100个零件需要几分钟? | 5 |
| logic-2 | 小明的妈妈有三个孩子,老大叫大毛,老二叫二毛,老三叫什么? | 小明 |
| logic-3 | 数列: 1, 11, 21, 1211, 111221, 下一项是什么? | 312211 |
| code-1 | 以下Python代码输出什么? print(sum(i for i in range(10) if i % 3 == 0)) | 18 |
| code-2 | JavaScript中 console.log(typeof NaN) 输出什么? | number |
| code-3 | 以下Python代码输出什么? a=[1,2,3] b=a b.append(4) print(len(a)) | 4 |
| code-4 | Python中 print(0.1+0.2==0.3) 输出什么? | False |
| cn-1 | 「落霞与孤鹜齐飞,秋水共长天一色」出自哪篇文章? | 滕王阁序 |
| cn-2 | 新加坡的建国总理是谁? | 李光耀 |
| inst-1 | 只输出一个JSON对象,包含键"name",值为"test"。不要输出任何其他文字、解释或代码块标记。 | {"name":"test"} |
| inst-2 | 把字符串 hello world 整体反转,只输出反转结果,不要任何其他文字。 | dlrow olleh |
除 inst-1/inst-2 外,所有题目末尾均附加统一作答指令:「请一步步思考,最后一行必须只写:答案: <你的最终答案>」。判分程序取最后一个「答案:」行做精确匹配。