DeepSeek V4 Flash 能力与 GLM-5.2 同档、显著优于 Kimi 2.6,默认智能体可以替换;但中台暂不支持思考强度调节,且现有并发无法支撑 KunMate 与坤匠合计 30 路的最低使用需求。
Flash 任务完成质量与阿里 GLM-5.2 持平,可作为同档能力方案;当前短板不在模型本身,而在中台接口。
依据。KunMate 39 道真实业务回归题中,中台 Flash-Code 与阿里 GLM-5.2 基本交付率均为 38/39(97.4%),验证后交付率均为 34/39(87.2%)。Flash 整批耗时约 33 分钟,长于阿里 GLM 的约 23 分钟。阿里 GLM 支持思考强度调节(生产可用 minimal 档);中台 Flash 仅支持思考开/关,无法调节推理强度。
建议。推动中台开放思考强度控制,以便在保证质量的同时压缩时延与并发占用。
同一评估条件下,Flash 明显强于中台 Kimi 2.6,默认对话与交付链路可以切换。
依据。Flash 基本交付率 / 验证后交付率为 97.4% / 87.2%;中台 Kimi 2.6(关闭深度推理)仅为 61.5% / 51.3%,且执行异常明显偏多。
建议。默认智能体替换为 Flash。高并发及重任务场景,待第 3、4 条容量条件满足后再切;Kimi 关闭深度推理目前仍承担脚本链等高并发任务。
Flash 轻量、中量负载尚可,重任务并发承载不足,不能按轻负载表现外推。
依据。坤匠压测中,轻量与中量在 16 路并发下交付成功率仍为 100%。重任务自 16 路起成功率降至 0%,112 个请求均在 2–3 秒内因连接失败被拒绝,测试窗口内未能自行恢复。属服务端不可达导致的级联中断,而非请求挂起。重任务安全水位约为 4–8 路。
建议。重任务入口限流至 4–8 路;排查连接失败根因,并补齐中断后自愈。
KunMate 与坤匠若共用同一套 DeepSeek 推理服务,现网最低使用需求约为 30 路并发,高于当前可稳定承载水位。
依据。两应用合计并发需求不低于 30 路。对照实测:轻量约在 16 路饱和,重任务在 16 路及以上中断,无法支撑 30 路合用。
建议。上线前完成扩容或限流分流。在第 3 条风险未解除、第 4 条容量未补齐前,不宜将两应用高并发流量切到 Flash。
本页为决策结论:第 1、2 条看能力与替换,第 3、4 条看并发与容量。 为 KunMate 39 题明细; 为坤匠 4–64 路压测明细。
采用同一批真实业务场景,横向比较阿里、中台、电信模型的交付能力与完成效率。 排名以基本交付率为主,并以验证后交付率对照。 Kimi K3「轻量」表示深度推理尽量收束,「深度」表示深度推理充分开启。
36 道反馈回归题 + 3 道门禁题,覆盖招标审查、融资填表、技能创建、经营分析、配矿等场景。
基本交付率:是否产出可用交付物。验证后交付率:交付物经核对后是否真正过关。
单题中位耗时、偏慢题耗时;整批完成时间反映一次跑完 39 题所需时长。
并列第一(97.4% / 87.2%):阿里 Kimi K3 轻量、阿里 GLM。阿里 DeepSeek Flash 最优表现为 94.9% / 89.7%,与 Qwen 基本交付率持平,验证后交付率更高,且整批最快(约 15 分钟)。中台 Flash-Code 约 89.8% / 84.6%,与电信 GLM 同档。中台 Kimi 关闭深度推理后明显偏弱。
相对深度设定,轻量档基本交付率更高(92.3%→97.4%),验证后交付率亦更好,整批耗时约缩短一半(约 36 分钟→18 分钟),执行异常更少。若选用 K3,建议优先轻量设定。
| 名次 | 模型 | 渠道 | 深度推理 | 基本交付 | 基本交付率 | 验证后交付 | 验证后交付率 | 中位(秒) | 偏慢(秒) | 整批(分) |
|---|
| 模型 | 交付未过关 | 执行异常 | 主要表现 |
|---|---|---|---|
| 阿里 Kimi K3 轻量 | 5 | 0 | 创建技能超时、澄清后停滞、经营分析无产物等 |
| 阿里 GLM | 5 | 0 | 新闻任务、创建技能、澄清后停滞等 |
| 阿里 DeepSeek Flash | 2 | 2 | 创建技能 / 澄清;另有 2 条执行异常 |
| 阿里 Qwen | 6 | 0 | 创建技能、澄清、经营分析等 |
| 阿里 Kimi K3 深度 | 4 | 2 | 澄清与经营分析;另有 2 条执行异常 |
| 中台 DeepSeek Flash-Code | 6 | 0 | 创建技能、澄清、经营分析、配矿等 |
| 电信 GLM | 5 | 1 | 创建技能、澄清、无产物;另有 1 条执行异常 |
| 中台 Kimi(关深度) | 9 | 10 | 交付失败与执行异常均偏多 |
创建技能超时、澄清后无法继续、创建技能无交付提示等,更接近产品流程问题,不宜归因于单一模型。
交付优先:阿里 Kimi K3 轻量 / GLM。质量与效率兼顾:阿里 DeepSeek Flash(94.9% / 89.7%,整批最快)。中台备选:Flash-Code(约 89.8%);不建议采用中台 Kimi 关闭深度推理。K3 建议优先轻量设定,无需开满深度推理。
轻量与中量负载可承载;轻载 64 路并发时 P95 越过告警线(WARN);重任务 16 路及以上出现级联中断(FAIL,成功率 0%),修复前不具备上线条件。
各层级按并发阶梯 4 / 8 / 16 / 32 / 64 路依次施压,请求均指向同一推理服务。成功率以完整交付计(HTTP 200 且任务产物齐全),而非仅 HTTP 层成功。
| 层级 | 场景 | 超时 | P95 判定 | 成功率判定 | 退化容忍 |
|---|---|---|---|---|---|
| light | 轻量对话 | 300s | PASS<60s / FAIL>120s | PASS≥95% / FAIL<80% | ≤15% |
| medium | Excel 数据分析 | 660s | PASS<400s / FAIL>600s | PASS≥80% / FAIL<60% | ≤25% |
| heavy | 多交付物重任务 | 900s | PASS<600s / FAIL>900s | PASS≥70% / FAIL<50% | ≤30% |
| 层级 | C=4 | C=8 | C=16 | C=32 | C=64 | 综合判定 |
|---|---|---|---|---|---|---|
| light 轻量对话 | PASS | PASS | PASS | PASS | WARN | WARN |
| medium Excel 分析 | PASS | PASS | PASS | PASS | PASS | PASS |
| heavy 多交付物 | PASS | PASS (87.5%) | FAIL | FAIL | FAIL | FAIL |
| 关键指标 | 数值 | 说明 |
|---|---|---|
| 最佳吞吐 | 12.84 tasks/min(medium C=32) | 较 C=4 放大 7.9x,延迟仅升 11.3% |
| 轻载极限 P95 | 64.8s(light C=64) | 越过 60s 告警线,未达 120s 失败线 |
| 重载崩溃成功率 | 0.0%(heavy C=16/32/64) | 共 112 个请求全部因连接失败(状态码 0)未完成 |
| 重载异常样本 | 113/113 | 全部为连接失败类异常(状态码 0) |
4–32 路全部通过,成功率 100%。吞吐在 16 路后封顶约 45 次/分钟(约为 4 路的 3.1 倍),表明轻载约在 16 路达到饱和。64 路时 P95 升至 64.8 秒,P50 / P95 较 4 路分别上升 3.1 倍 / 4.0 倍,属排队延迟,而非服务异常。
| C | 成功率 | P50 | P95 | P99 | Max | 吞吐/min | 状态码 | 判定 |
|---|---|---|---|---|---|---|---|---|
| 4 | 100% | 16.2s | 16.4s | 16.4s | 16.4s | 14.5 | 200×4 | PASS |
| 8 | 100% | 16.8s | 20.0s | 20.0s | 23.1s | 20.7 | 200×8 | PASS |
| 16 | 100% | 18.0s | 21.1s | 21.1s | 21.1s | 45.4 | 200×16 | PASS |
| 32 | 100% | 32.1s | 41.5s | 44.6s | 44.7s | 42.9 | 200×32 | PASS |
| 64 | 100% | 49.7s | 64.8s | 67.9s | 84.4s | 45.4 | 200×64 | WARN |
该层级表现最优。全部并发档成功率 100%,P95 最高 213.1 秒(低于 400 秒判定线),扩展性良好。需关注:64 路时长尾显著恶化(P99 302.9 秒、最大值 468.6 秒),吞吐回落至 8.19 次/分钟,不建议作为常态运行水位。
| C | 成功率 | P50 | P95 | P99 | Max | 吞吐/min | 状态码 | 判定 |
|---|---|---|---|---|---|---|---|---|
| 4 | 100% | 119.3s | 128.8s | 128.8s | 147.4s | 1.63 | 200×4 | PASS |
| 8 | 100% | 114.3s | 123.8s | 123.8s | 147.7s | 3.25 | 200×8 | PASS |
| 16 | 100% | 102.3s | 133.9s | 133.9s | 187.2s | 5.13 | 200×16 | PASS |
| 32 | 100% | 118.3s | 143.4s | 143.5s | 149.5s | 12.84 | 200×32 | PASS |
| 64 | 100% | 167.6s | 213.1s | 302.9s | 468.6s | 8.19 | 200×64 | PASS |
4 路全部成功(P95 309.6 秒);8 路出现首个失败(7/8,状态码 0)。自 16 路起发生级联中断:16 / 32 / 64 路共 112 个请求全部以状态码 0(连接失败)在 2–3 秒内被拒绝,成功率 0%,且三档测试间隔内服务均未恢复。
| C | HTTP OK | 完整交付 | 成功率 | P50 | P95 | 状态码 | 判定 |
|---|---|---|---|---|---|---|---|
| 4 | 4/4 | 4/4 | 100% | 228.5s | 309.6s | 200×4 | PASS |
| 8 | 7/8 | 7/8 | 87.5% | 327.4s | 404.5s | 0×1, 200×7 | PASS |
| 16 | 0/16 | 0/16 | 0.0% | 2.4s | 2.5s | 0×16 | FAIL |
| 32 | 0/32 | 0/32 | 0.0% | 2.5s | 2.7s | 0×32 | FAIL |
| 64 | 0/64 | 0/64 | 0.0% | 2.8s | 3.2s | 0×64 | FAIL |
安全水位不超过 32 路;64 路仅告警未失败,建议限流在 32–48 路。
最佳工作点为 32 路(吞吐 12.84 次/分钟);64 路长尾过重,不建议作为常态水位。
当前仅能稳定承载 4 路(8 路已出现失败),16 路及以上发生服务中断。
数据来源:KunLand Performance Reports ×3(light 02:32 / medium 02:51 / heavy 03:07,2026-08-25)· 完整交付口径