你的客户原来用什么模型我们并不知道,但只要把本平台提供的三款模型,和当前国际公认最强的 Claude、GPT 旗舰放进同一套题、同一判分标准里横向比一次,客户就能对我们算力上跑的模型有一个客观坐标——差多少、强在哪、性价比几何。
国际旗舰在本报告中的角色是「准确率锚点」(参照系),不是速度竞争对手——原因见 §2 公平性说明。
| 项目 | 参数 |
|---|---|
| 硬件 | 标准测试主机(仅发起 API 请求,不参与推理,本机配置不影响结果) |
| 软件 | macOS 12.7.6 · Python 3.14.5 · Codex CLI 0.140 · Claude CLI 2.1.195 |
| 网络 | 家用 WiFi(5GHz),到本平台端点平均延迟 33.5ms,0% 丢包(详见 v1.1 报告) |
| 本平台模型 | deepseek-v4-flash · kimi-k2.6(w4a8量化版) · qwen3.5-flash(强制思考),经本平台 API 端点调用 |
| 国际锚点·Claude | Claude Fable 5 + Claude Opus 4.8,经 Claude CLI,推理档 medium |
| 国际锚点·GPT | GPT-5.6-sol + GPT-5.5,经 Codex CLI,推理档 medium |
六大板块各自的得分。本平台模型与国际旗舰的差距主要出现在竞赛数学与指令遵循的边界情形。
柱状为「答对题平均耗时」(排除超时失败题,反映真实作答延迟)。本平台三款模型同为 API 调用,口径一致。
| 本平台模型 | 答对题平均耗时 | 全题平均(含超时) | 备注 |
|---|---|---|---|
| kimi-k2.6 | 37.8s | 60.4s | 含 1 道未通过 |
| deepseek-v4-flash | 8.5s | 8.3s | 含 2 道未通过 |
| qwen3.5-flash | 116.4s | 174.6s | 含 3 道未通过 |
"全题平均"包含因思考超过服务端约600秒超时而返回空的题;qwen3.5-flash 两个口径差距悬殊,正说明它在难题上有「想太久直接超时」的风险。
✅通过 ❌答错 ⛔报错/无输出。鼠标悬停单元格可看判分细节。
| 题号 | 板块 | claude-fable-5 | claude-opus-4-8 | gpt-5.6-sol | kimi-k2.6 | gpt-5.5 | deepseek-v4-flash | qwen3.5-flash |
|---|---|---|---|---|---|---|---|---|
| M1 | 竞赛数学 | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| M2 | 竞赛数学 | ✅ | ✅ | ✅ | ❌ | ❌ | ✅ | ❌ |
| M3 | 竞赛数学 | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| M4 | 竞赛数学 | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| M5 | 竞赛数学 | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ❌ |
| P1 | 竞赛编程 | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| P2 | 竞赛编程 | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| P3 | 竞赛编程 | ✅ | ✅ | ✅ | ✅ | ✅ | ❌ | ❌ |
| P4 | 竞赛编程 | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| P5 | 竞赛编程 | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| P6 | 竞赛编程 | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| I1 | 指令遵循 | ✅ | ✅ | ✅ | ✅ | ✅ | ❌ | ✅ |
| I2 | 指令遵循 | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| I3 | 指令遵循 | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| I4 | 指令遵循 | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| I5 | 指令遵循 | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| F1 | 函数调用 | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| F2 | 函数调用 | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| F3 | 函数调用 | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| F4 | 函数调用 | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| L1 | 长文本理解 | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| L2 | 长文本理解 | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| L3 | 长文本理解 | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| C1 | 中文理解 | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| C2 | 中文理解 | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ |
| 使用场景 | 推荐机型 | 理由 |
|---|---|---|
| 客服 / 翻译 / 高频问答 / Agent 工具调用 | deepseek-v4-flash | 速度最快、成本最低,准确率第一梯队 |
| 内容创作 / 通用综合任务 | kimi-k2.6 | 综合能力强、编程满分;注意为量化版,极难推理题偶有不收敛 |
| 深度推理 / 复杂数学分析(不赶时间) | qwen3.5-flash | 推理最扎实,但最慢、token 成本最高,需预留大预算 |
| 板块 | 为什么这样测 |
|---|---|
| 竞赛数学 | AIME/竞赛级,唯一数字答案。用于突破天花板——旗舰模型也可能算错,才能拉开区分度。全部答案经本机暴力计算验证。 |
| 竞赛编程 | LiveCodeBench 风格算法题。判分方式是把模型给的代码在本机实际运行、跑隐藏测试用例——这是区分度最强、最难作弊的板块。 |
| 指令遵循 | IFEval 风格多重硬约束(字数/关键词/格式/总和同时满足)。考察模型能否严格照做,直接关系 Agent/结构化输出场景。 |
| 函数调用 | 给工具 schema,要求输出正确的调用 JSON。Agent 类客户最关心;判分为 JSON 深度比对(城市名中英等价)。 |
| 长文本理解 | 1.5万字虚构公司报告里埋 needle/多跳/聚合三类考点。考察长上下文检索与推理,唯一答案匹配。 |
| 中文理解 | 文言文/成语等中文深水区,唯一答案。考察中文母语级理解。 |
| 题号 | 题目(摘要) | 标准答案 |
|---|---|---|
| M1 | 2026! (2026的阶乘)的十进制表示末尾有多少个连续的0? | 505 |
| M2 | 求所有满足 φ(n)=24 的正整数 n 之和,其中 φ 是欧拉函数。 | 621 |
| M3 | 设 S = 1·2¹ + 2·2² + 3·2³ + … + 100·2¹⁰⁰,求 S 除以 1000 的余数。 | 450 |
| M4 | 满足 a+b+c=2026 且 1≤a≤b≤c 的整数三元组 (a,b,c) 共有多少组? | 342056 |
| M5 | 数列定义:a₁=1,对 n≥1 有 aₙ₊₁ = aₙ + gcd(n, aₙ)。求 a₁₀₀ 的值。 | 101 |
| P1 | 实现函数 solve(intervals),输入若干闭区间(列表的列表,可能无序、可能为空),合并所有重叠或相接的区间(如[1,4]与[4,5]视为相接需合并),返回按起点升序排列的合并结果。 | 见校验器 |
| P2 | 实现函数 solve(s),返回字符串 s 的最长回文子串的长度(整数)。空串返回0。 | 见校验器 |
| P3 | 实现函数 solve(expr),计算四则运算表达式字符串的值并返回整数。支持 + - * / 、圆括号、一元负号与任意空格;除法为整数除法且向零取整(注意:(8-10)/3 应等于 0 而不是 -1)。 | 见校验器 |
| P4 | 实现函数 solve(coins, amount),返回用面值列表 coins(每种面值可无限次使用)凑出金额 amount 的组合数(不考虑顺序)。amount 为0时返回1。 | 见校验器 |
| P5 | 实现函数 solve(n, prerequisites),有 n 门课编号0..n-1,prerequisites 中每项 [a,b] 表示修 a 前必须先修 b。返回字典序最小的合法修课顺序(列表);若存在环无法完成,返回空列表 []。 | 见校验器 |
| P6 | 实现函数 solve(heights),给定直方图各柱高度(非负整数列表,柱宽均为1),返回能从中框出的最大矩形面积(整数)。空列表返回0。 | 见校验器 |
| I1 | 写一段恰好50个汉字的云计算产品介绍:必须同时包含「云端」和「安全」两个词,不得出现任何标点符号、数字、英文字母, | 见校验器 |
| I2 | 见校验器 | |
| I3 | 写一首四行藏头诗:每行恰好7个汉字、不含任何标点,四行的第一个字连起来恰好是「算力出海」。 | 见校验器 |
| I4 | 将这5个单词按字母表倒序排列输出:apple, banana, cherry, date, elderberry。共5行,每行格式为「N) WORD」:N 是行号,从5开始逐行递减到1;WORD 全部大写。 | 见校验器 |
| I5 | 把这句话翻译成英文:「我们为出海企业提供稳定的算力基础设施和本地化的合规支持。」要求:译文恰好两句话;每句不超过15个英文单词;必须包含单词 infrastructure。 | 见校验器 |
| F1 | 可用工具:get_weather(city: string, unit: "celsius"|"fahrenheit")。 用户说:「帮我查一下新加坡现在多少度,用摄氏度。」 | {"tool": "get_weather", "arguments": {"city": "新加坡", "unit": "celsius"}} |
| F2 | 可用工具:book_meeting_room(room_id: string, start: string ISO8601格式如2026-01-02T09:00:00, duration_minutes: integer)。 用户说:「帮我订 A-301 会议室,2026年7月15日下午2点开始,开一个半小时。」 | {"tool": "book_meeting_room", "arguments": {"room_id": "A-301", "start": "2026-07-15T14:00:00", "duration_minutes": 90}} |
| F3 | 可用工具(三选一,只能调用其中一个): 1. send_email(to: string, subject: string, body: string) 2. create_task(title: string, due_date: string 格式YYYY-MM-DD, priority: "low"|"medium"|"high") 3. search_docs(keyword: strin…(长文本略) | {"tool": "create_task", "arguments": {"title": "准备Q3本平台评审材料", "due_date": "2026-07-20", "priority": "high"}} |
| F4 | 可用工具:create_order(customer_id: string, items: array,数组每项为对象 {sku: string, qty: integer})。 用户说:「客户C88下单:K100两件,M200一件,按这个顺序录。」 | {"tool": "create_order", "arguments": {"customer_id": "C88", "items": [{"sku": "K100", "qty": 2}, {"sku": "M200", "qty": 1}]}} |
| L1 | 阅读下面的公司年度报告,回答:2025年第三季度数据中心的平均PUE值是多少? | 1.18 |
| L2 | 阅读下面的公司年度报告,回答:海外事业部的年度预算是多少万元?(报告中未直接给出数字,需要根据报告披露的信息推算) | 13600 / 1.36 / 13,600 |
| L3 | 阅读下面的公司年度报告,回答:公司2025年全年营业收入共多少亿元?(报告只披露了各季度数字,需要汇总,保留两位小数) | 11.98 |
| C1 | 《出师表》开篇「先帝创业未半而中道崩殂」,这里的「先帝」指的是谁? | 刘备 |
| C2 | 成语「汗牛充栋」形容的是什么东西非常多? | 书 |