English →

模型定位评测报告 · v2

本平台模型 vs 国际旗舰(准确率锚点)测试日期:2026-07-137个模型 × 25题

一、这份报告解决什么问题

你的客户原来用什么模型我们并不知道,但只要把本平台提供的三款模型,和当前国际公认最强的 Claude、GPT 旗舰放进同一套题、同一判分标准里横向比一次,客户就能对我们算力上跑的模型有一个客观坐标——差多少、强在哪、性价比几何

国际旗舰在本报告中的角色是「准确率锚点」(参照系),不是速度竞争对手——原因见 §2 公平性说明。

本平台最高分
24/25
kimi-k2.6
本平台最快
8.3s/题
deepseek-v4-flash
国际旗舰满分线
25/25
与旗舰差距见下表

二、测试环境与公平性设计

项目参数
硬件标准测试主机(仅发起 API 请求,不参与推理,本机配置不影响结果)
软件macOS 12.7.6 · Python 3.14.5 · Codex CLI 0.140 · Claude CLI 2.1.195
网络家用 WiFi(5GHz),到本平台端点平均延迟 33.5ms,0% 丢包(详见 v1.1 报告)
本平台模型deepseek-v4-flash · kimi-k2.6(w4a8量化版) · qwen3.5-flash(强制思考),经本平台 API 端点调用
国际锚点·ClaudeClaude Fable 5 + Claude Opus 4.8,经 Claude CLI,推理档 medium
国际锚点·GPTGPT-5.6-sol + GPT-5.5,经 Codex CLI,推理档 medium

为保证公平,做了这些控制(全部可复现)

速度口径说明(重要):本平台模型走 API,Claude/GPT 走 CLI 子进程(带 2~4 秒固定启动开销)。因此速度只在本平台三款模型之间横向可比;国际旗舰的耗时不与本平台模型直接对比,它们只作准确率锚点。

三、总分对比(7个模型)

本平台模型国际旗舰(准确率锚点)
0 5 10 15 20 25 claude-fable-5 claude-fable-5: 25/25 25/25 锚点 claude-opus-4-8 claude-opus-4-8: 25/25 25/25 锚点 gpt-5.6-sol gpt-5.6-sol: 25/25 25/25 锚点 kimi-k2.6 kimi-k2.6: 24/25 24/25 本平台 gpt-5.5 gpt-5.5: 24/25 24/25 锚点 deepseek-v4-flash deepseek-v4-flash: 23/25 23/25 本平台 qwen3.5-flash qwen3.5-flash: 22/25 22/25 本平台

四、分板块得分

六大板块各自的得分。本平台模型与国际旗舰的差距主要出现在竞赛数学与指令遵循的边界情形。

本平台国际旗舰
竞赛数学(满分5) claude-fable-5 claude-fable-5 · 竞赛数学: 5/5 5/5 claude-opus-4-8 claude-opus-4-8 · 竞赛数学: 5/5 5/5 gpt-5.6-sol gpt-5.6-sol · 竞赛数学: 5/5 5/5 kimi-k2.6 kimi-k2.6 · 竞赛数学: 4/5 4/5 gpt-5.5 gpt-5.5 · 竞赛数学: 4/5 4/5 deepseek-v4-flash deepseek-v4-flash · 竞赛数学: 5/5 5/5 qwen3.5-flash qwen3.5-flash · 竞赛数学: 3/5 3/5 竞赛编程(满分6) claude-fable-5 claude-fable-5 · 竞赛编程: 6/6 6/6 claude-opus-4-8 claude-opus-4-8 · 竞赛编程: 6/6 6/6 gpt-5.6-sol gpt-5.6-sol · 竞赛编程: 6/6 6/6 kimi-k2.6 kimi-k2.6 · 竞赛编程: 6/6 6/6 gpt-5.5 gpt-5.5 · 竞赛编程: 6/6 6/6 deepseek-v4-flash deepseek-v4-flash · 竞赛编程: 5/6 5/6 qwen3.5-flash qwen3.5-flash · 竞赛编程: 5/6 5/6 指令遵循(满分5) claude-fable-5 claude-fable-5 · 指令遵循: 5/5 5/5 claude-opus-4-8 claude-opus-4-8 · 指令遵循: 5/5 5/5 gpt-5.6-sol gpt-5.6-sol · 指令遵循: 5/5 5/5 kimi-k2.6 kimi-k2.6 · 指令遵循: 5/5 5/5 gpt-5.5 gpt-5.5 · 指令遵循: 5/5 5/5 deepseek-v4-flash deepseek-v4-flash · 指令遵循: 4/5 4/5 qwen3.5-flash qwen3.5-flash · 指令遵循: 5/5 5/5 函数调用(满分4) claude-fable-5 claude-fable-5 · 函数调用: 4/4 4/4 claude-opus-4-8 claude-opus-4-8 · 函数调用: 4/4 4/4 gpt-5.6-sol gpt-5.6-sol · 函数调用: 4/4 4/4 kimi-k2.6 kimi-k2.6 · 函数调用: 4/4 4/4 gpt-5.5 gpt-5.5 · 函数调用: 4/4 4/4 deepseek-v4-flash deepseek-v4-flash · 函数调用: 4/4 4/4 qwen3.5-flash qwen3.5-flash · 函数调用: 4/4 4/4 长文本理解(满分3) claude-fable-5 claude-fable-5 · 长文本理解: 3/3 3/3 claude-opus-4-8 claude-opus-4-8 · 长文本理解: 3/3 3/3 gpt-5.6-sol gpt-5.6-sol · 长文本理解: 3/3 3/3 kimi-k2.6 kimi-k2.6 · 长文本理解: 3/3 3/3 gpt-5.5 gpt-5.5 · 长文本理解: 3/3 3/3 deepseek-v4-flash deepseek-v4-flash · 长文本理解: 3/3 3/3 qwen3.5-flash qwen3.5-flash · 长文本理解: 3/3 3/3 中文理解(满分2) claude-fable-5 claude-fable-5 · 中文理解: 2/2 2/2 claude-opus-4-8 claude-opus-4-8 · 中文理解: 2/2 2/2 gpt-5.6-sol gpt-5.6-sol · 中文理解: 2/2 2/2 kimi-k2.6 kimi-k2.6 · 中文理解: 2/2 2/2 gpt-5.5 gpt-5.5 · 中文理解: 2/2 2/2 deepseek-v4-flash deepseek-v4-flash · 中文理解: 2/2 2/2 qwen3.5-flash qwen3.5-flash · 中文理解: 2/2 2/2

五、关键发现

关于本报告的性质:本报告为 2026-07-13 实测快照。以上实测中发现的问题(如个别模型在极难推理题上不收敛、强制思考模式的超时风险),本平台已第一时间反馈至算力服务方,相关模型参数正在调整优化中。我们对上线模型持续实测与跟踪、发现问题即时闭环,而非一次性采信——这也是我们把实测报告公开给客户的原因。

六、本平台三款主力模型:速度对比

kimi-k2.6 kimi-k2.6: 答对题平均 37.8s 37.8s deepseek-v4-flash deepseek-v4-flash: 答对题平均 8.5s 8.5s qwen3.5-flash qwen3.5-flash: 答对题平均 116.4s 116.4s

柱状为「答对题平均耗时」(排除超时失败题,反映真实作答延迟)。本平台三款模型同为 API 调用,口径一致。

本平台模型答对题平均耗时全题平均(含超时)备注
kimi-k2.637.8s60.4s含 1 道未通过
deepseek-v4-flash8.5s8.3s含 2 道未通过
qwen3.5-flash116.4s174.6s含 3 道未通过

"全题平均"包含因思考超过服务端约600秒超时而返回空的题;qwen3.5-flash 两个口径差距悬殊,正说明它在难题上有「想太久直接超时」的风险。

七、逐题对错矩阵(7×25)

✅通过 ❌答错 ⛔报错/无输出。鼠标悬停单元格可看判分细节。

题号板块claude-fable-5claude-opus-4-8gpt-5.6-solkimi-k2.6gpt-5.5deepseek-v4-flashqwen3.5-flash
M1竞赛数学
M2竞赛数学
M3竞赛数学
M4竞赛数学
M5竞赛数学
P1竞赛编程
P2竞赛编程
P3竞赛编程
P4竞赛编程
P5竞赛编程
P6竞赛编程
I1指令遵循
I2指令遵循
I3指令遵循
I4指令遵循
I5指令遵循
F1函数调用
F2函数调用
F3函数调用
F4函数调用
L1长文本理解
L2长文本理解
L3长文本理解
C1中文理解
C2中文理解

八、选型建议

使用场景推荐机型理由
客服 / 翻译 / 高频问答 / Agent 工具调用deepseek-v4-flash速度最快、成本最低,准确率第一梯队
内容创作 / 通用综合任务kimi-k2.6综合能力强、编程满分;注意为量化版,极难推理题偶有不收敛
深度推理 / 复杂数学分析(不赶时间)qwen3.5-flash推理最扎实,但最慢、token 成本最高,需预留大预算

附录 A · 25 道题目、板块理由与标准答案

板块为什么这样测
竞赛数学AIME/竞赛级,唯一数字答案。用于突破天花板——旗舰模型也可能算错,才能拉开区分度。全部答案经本机暴力计算验证。
竞赛编程LiveCodeBench 风格算法题。判分方式是把模型给的代码在本机实际运行、跑隐藏测试用例——这是区分度最强、最难作弊的板块。
指令遵循IFEval 风格多重硬约束(字数/关键词/格式/总和同时满足)。考察模型能否严格照做,直接关系 Agent/结构化输出场景。
函数调用给工具 schema,要求输出正确的调用 JSON。Agent 类客户最关心;判分为 JSON 深度比对(城市名中英等价)。
长文本理解1.5万字虚构公司报告里埋 needle/多跳/聚合三类考点。考察长上下文检索与推理,唯一答案匹配。
中文理解文言文/成语等中文深水区,唯一答案。考察中文母语级理解。
题号题目(摘要)标准答案
M12026! (2026的阶乘)的十进制表示末尾有多少个连续的0?505
M2求所有满足 φ(n)=24 的正整数 n 之和,其中 φ 是欧拉函数。621
M3设 S = 1·2¹ + 2·2² + 3·2³ + … + 100·2¹⁰⁰,求 S 除以 1000 的余数。450
M4满足 a+b+c=2026 且 1≤a≤b≤c 的整数三元组 (a,b,c) 共有多少组?342056
M5数列定义:a₁=1,对 n≥1 有 aₙ₊₁ = aₙ + gcd(n, aₙ)。求 a₁₀₀ 的值。101
P1实现函数 solve(intervals),输入若干闭区间(列表的列表,可能无序、可能为空),合并所有重叠或相接的区间(如[1,4]与[4,5]视为相接需合并),返回按起点升序排列的合并结果。见校验器
P2实现函数 solve(s),返回字符串 s 的最长回文子串的长度(整数)。空串返回0。见校验器
P3实现函数 solve(expr),计算四则运算表达式字符串的值并返回整数。支持 + - * / 、圆括号、一元负号与任意空格;除法为整数除法且向零取整(注意:(8-10)/3 应等于 0 而不是 -1)。见校验器
P4实现函数 solve(coins, amount),返回用面值列表 coins(每种面值可无限次使用)凑出金额 amount 的组合数(不考虑顺序)。amount 为0时返回1。见校验器
P5实现函数 solve(n, prerequisites),有 n 门课编号0..n-1,prerequisites 中每项 [a,b] 表示修 a 前必须先修 b。返回字典序最小的合法修课顺序(列表);若存在环无法完成,返回空列表 []。见校验器
P6实现函数 solve(heights),给定直方图各柱高度(非负整数列表,柱宽均为1),返回能从中框出的最大矩形面积(整数)。空列表返回0。见校验器
I1写一段恰好50个汉字的云计算产品介绍:必须同时包含「云端」和「安全」两个词,不得出现任何标点符号、数字、英文字母,见校验器
I2见校验器
I3写一首四行藏头诗:每行恰好7个汉字、不含任何标点,四行的第一个字连起来恰好是「算力出海」。见校验器
I4将这5个单词按字母表倒序排列输出:apple, banana, cherry, date, elderberry。共5行,每行格式为「N) WORD」:N 是行号,从5开始逐行递减到1;WORD 全部大写。见校验器
I5把这句话翻译成英文:「我们为出海企业提供稳定的算力基础设施和本地化的合规支持。」要求:译文恰好两句话;每句不超过15个英文单词;必须包含单词 infrastructure。见校验器
F1可用工具:get_weather(city: string, unit: "celsius"|"fahrenheit")。 用户说:「帮我查一下新加坡现在多少度,用摄氏度。」{"tool": "get_weather", "arguments": {"city": "新加坡", "unit": "celsius"}}
F2可用工具:book_meeting_room(room_id: string, start: string ISO8601格式如2026-01-02T09:00:00, duration_minutes: integer)。 用户说:「帮我订 A-301 会议室,2026年7月15日下午2点开始,开一个半小时。」{"tool": "book_meeting_room", "arguments": {"room_id": "A-301", "start": "2026-07-15T14:00:00", "duration_minutes": 90}}
F3可用工具(三选一,只能调用其中一个): 1. send_email(to: string, subject: string, body: string) 2. create_task(title: string, due_date: string 格式YYYY-MM-DD, priority: "low"|"medium"|"high") 3. search_docs(keyword: strin…(长文本略){"tool": "create_task", "arguments": {"title": "准备Q3本平台评审材料", "due_date": "2026-07-20", "priority": "high"}}
F4可用工具:create_order(customer_id: string, items: array,数组每项为对象 {sku: string, qty: integer})。 用户说:「客户C88下单:K100两件,M200一件,按这个顺序录。」{"tool": "create_order", "arguments": {"customer_id": "C88", "items": [{"sku": "K100", "qty": 2}, {"sku": "M200", "qty": 1}]}}
L1阅读下面的公司年度报告,回答:2025年第三季度数据中心的平均PUE值是多少?1.18
L2阅读下面的公司年度报告,回答:海外事业部的年度预算是多少万元?(报告中未直接给出数字,需要根据报告披露的信息推算)13600 / 1.36 / 13,600
L3阅读下面的公司年度报告,回答:公司2025年全年营业收入共多少亿元?(报告只披露了各季度数字,需要汇总,保留两位小数)11.98
C1《出师表》开篇「先帝创业未半而中道崩殂」,这里的「先帝」指的是谁?刘备
C2成语「汗牛充栋」形容的是什么东西非常多?

附录 B · 复现方式