中台DeepSeek V4 Flash模型性能评估结果

评估结论

测试日期 2026-08-25 · KunMate 智能体能力评估(39 题)+ 坤匠 DeepSeek V4 并发压测
评估完成 1–2 能力与替换 3–4 并发与容量
一句话

DeepSeek V4 Flash 能力与 GLM-5.2 同档、显著优于 Kimi 2.6,默认智能体可以替换;但中台暂不支持思考强度调节,且现有并发无法支撑 KunMate 与坤匠合计 30 路的最低使用需求。

97.4%
Flash 与阿里 GLM · 基本交付率持平
61.5%
中台 Kimi 2.6 · 关闭深度推理
0%
重任务 16 路及以上成功率
≥30 路
两应用合计最低并发需求
1

对标 GLM-5.2:能力相当,中台需补齐思考强度控制

Flash 任务完成质量与阿里 GLM-5.2 持平,可作为同档能力方案;当前短板不在模型本身,而在中台接口。

依据。KunMate 39 道真实业务回归题中,中台 Flash-Code 与阿里 GLM-5.2 基本交付率均为 38/39(97.4%),验证后交付率均为 34/39(87.2%)。Flash 整批耗时约 33 分钟,长于阿里 GLM 的约 23 分钟。阿里 GLM 支持思考强度调节(生产可用 minimal 档);中台 Flash 仅支持思考开/关,无法调节推理强度。

建议。推动中台开放思考强度控制,以便在保证质量的同时压缩时延与并发占用。

2

对标 Kimi 2.6:显著更优,建议替换默认智能体

同一评估条件下,Flash 明显强于中台 Kimi 2.6,默认对话与交付链路可以切换。

依据。Flash 基本交付率 / 验证后交付率为 97.4% / 87.2%;中台 Kimi 2.6(关闭深度推理)仅为 61.5% / 51.3%,且执行异常明显偏多。

建议。默认智能体替换为 Flash。高并发及重任务场景,待第 3、4 条容量条件满足后再切;Kimi 关闭深度推理目前仍承担脚本链等高并发任务。

3

并发风险:重任务在 16 路下服务中断

Flash 轻量、中量负载尚可,重任务并发承载不足,不能按轻负载表现外推。

依据。坤匠压测中,轻量与中量在 16 路并发下交付成功率仍为 100%。重任务自 16 路起成功率降至 0%,112 个请求均在 2–3 秒内因连接失败被拒绝,测试窗口内未能自行恢复。属服务端不可达导致的级联中断,而非请求挂起。重任务安全水位约为 4–8 路。

建议。重任务入口限流至 4–8 路;排查连接失败根因,并补齐中断后自愈。

4

容量结论:两应用合计至少 30 路,现有容量无法满足

KunMate 与坤匠若共用同一套 DeepSeek 推理服务,现网最低使用需求约为 30 路并发,高于当前可稳定承载水位。

依据。两应用合计并发需求不低于 30 路。对照实测:轻量约在 16 路饱和,重任务在 16 路及以上中断,无法支撑 30 路合用。

建议。上线前完成扩容或限流分流。在第 3 条风险未解除、第 4 条容量未补齐前,不宜将两应用高并发流量切到 Flash。

报告结构

本页为决策结论:第 1、2 条看能力与替换,第 3、4 条看并发与容量。 为 KunMate 39 题明细; 为坤匠 4–64 路压测明细。

能力对比 · KunMate 真实业务回归(39 题)

同一题集、同一环境横向评估 · 测试日期 2026-08-25 · 主指标为基本交付率 · 共 8 档模型
评估完成 阿里 ×5 中台 ×2 电信 ×1

评估说明

采用同一批真实业务场景,横向比较阿里、中台、电信模型的交付能力与完成效率。 排名以基本交付率为主,并以验证后交付率对照。 Kimi K3「轻量」表示深度推理尽量收束,「深度」表示深度推理充分开启。

题集

36 道反馈回归题 + 3 道门禁题,覆盖招标审查、融资填表、技能创建、经营分析、配矿等场景。

成功率口径

基本交付率:是否产出可用交付物。验证后交付率:交付物经核对后是否真正过关。

效率口径

单题中位耗时、偏慢题耗时;整批完成时间反映一次跑完 39 题所需时长。

97.4%
并列第1 · K3 轻量 / GLM
94.9% / 89.7%
阿里 DeepSeek Flash 最优表现
89.8%
中台 Flash-Code · 基本交付率
61.5%
末位 · 中台 Kimi 关深度
结果摘要(以基本交付率为主)

并列第一(97.4% / 87.2%):阿里 Kimi K3 轻量、阿里 GLM。阿里 DeepSeek Flash 最优表现为 94.9% / 89.7%,与 Qwen 基本交付率持平,验证后交付率更高,且整批最快(约 15 分钟)。中台 Flash-Code 约 89.8% / 84.6%,与电信 GLM 同档。中台 Kimi 关闭深度推理后明显偏弱。

Kimi K3:轻量与深度对照

相对深度设定,轻量档基本交付率更高(92.3%→97.4%),验证后交付率亦更好,整批耗时约缩短一半(约 36 分钟→18 分钟),执行异常更少。若选用 K3,建议优先轻量设定。

交付成功率(39 题,基本交付率为主)

基本交付率 (%)验证后交付率 (%)
测试日期 2026-08-25 · 按基本交付率排序

单题耗时(秒,越低越快)

中位耗时 (秒)偏慢题耗时 (秒)

整批完成时间(分钟)

全量排行榜(按基本交付率)

名次模型渠道深度推理 基本交付基本交付率验证后交付验证后交付率 中位(秒)偏慢(秒)整批(分)

失败情况概览

模型交付未过关执行异常主要表现
阿里 Kimi K3 轻量50创建技能超时、澄清后停滞、经营分析无产物等
阿里 GLM50新闻任务、创建技能、澄清后停滞等
阿里 DeepSeek Flash22创建技能 / 澄清;另有 2 条执行异常
阿里 Qwen60创建技能、澄清、经营分析等
阿里 Kimi K3 深度42澄清与经营分析;另有 2 条执行异常
中台 DeepSeek Flash-Code60创建技能、澄清、经营分析、配矿等
电信 GLM51创建技能、澄清、无产物;另有 1 条执行异常
中台 Kimi(关深度)910交付失败与执行异常均偏多
共性失败点

创建技能超时、澄清后无法继续、创建技能无交付提示等,更接近产品流程问题,不宜归因于单一模型。

选型建议(以基本交付率为主)

交付优先:阿里 Kimi K3 轻量 / GLM。质量与效率兼顾:阿里 DeepSeek Flash(94.9% / 89.7%,整批最快)。中台备选:Flash-Code(约 89.8%);不建议采用中台 Kimi 关闭深度推理。K3 建议优先轻量设定,无需开满深度推理。

并发对比 · 坤匠 DeepSeek V4 压测

测试日期 2026-08-25 · 模型 DeepSeek V4(服务默认)· 实测任务 124 个
评估完成 轻量 WARN 中量 PASS 重量 FAIL
WARN
轻量对话 · C=64 P95 越线
PASS
Excel 分析 · 全档 100%
FAIL
重任务 · C≥16 成功率 0%
12.84/min
最佳吞吐 · medium C=32
总体结论

轻量与中量负载可承载;轻载 64 路并发时 P95 越过告警线(WARN);重任务 16 路及以上出现级联中断(FAIL,成功率 0%),修复前不具备上线条件。

1 测试方法与判定阈值

各层级按并发阶梯 4 / 8 / 16 / 32 / 64 路依次施压,请求均指向同一推理服务。成功率以完整交付计(HTTP 200 且任务产物齐全),而非仅 HTTP 层成功。

层级场景超时P95 判定成功率判定退化容忍
light轻量对话300sPASS<60s / FAIL>120sPASS≥95% / FAIL<80%≤15%
mediumExcel 数据分析660sPASS<400s / FAIL>600sPASS≥80% / FAIL<60%≤25%
heavy多交付物重任务900sPASS<600s / FAIL>900sPASS≥70% / FAIL<50%≤30%

2 结果总览

层级C=4C=8C=16C=32C=64综合判定
light 轻量对话 PASSPASSPASSPASS WARNWARN
medium Excel 分析 PASSPASSPASSPASS PASSPASS
heavy 多交付物 PASSPASS (87.5%) FAILFAILFAIL FAIL
关键指标数值说明
最佳吞吐12.84 tasks/min(medium C=32)较 C=4 放大 7.9x,延迟仅升 11.3%
轻载极限 P9564.8s(light C=64)越过 60s 告警线,未达 120s 失败线
重载崩溃成功率0.0%(heavy C=16/32/64)共 112 个请求全部因连接失败(状态码 0)未完成
重载异常样本113/113全部为连接失败类异常(状态码 0)

成功率随并发变化

轻量 (%) 中量 (%) 重量 (%)
测试日期 2026-08-25 · 坤匠 · 完整交付成功率 · 4–64 路并发

吞吐(tasks/min)

轻量对话 Excel 分析
轻量约在 16 路饱和,吞吐约 45 次/分钟;中量最佳工作点为 32 路

3 轻量对话(Light Chat)— WARN

4–32 路全部通过,成功率 100%。吞吐在 16 路后封顶约 45 次/分钟(约为 4 路的 3.1 倍),表明轻载约在 16 路达到饱和。64 路时 P95 升至 64.8 秒,P50 / P95 较 4 路分别上升 3.1 倍 / 4.0 倍,属排队延迟,而非服务异常。

C成功率P50P95P99Max吞吐/min状态码判定
4100%16.2s16.4s16.4s16.4s14.5200×4PASS
8100%16.8s20.0s20.0s23.1s20.7200×8PASS
16100%18.0s21.1s21.1s21.1s45.4200×16PASS
32100%32.1s41.5s44.6s44.7s42.9200×32PASS
64100%49.7s64.8s67.9s84.4s45.4200×64WARN

4 Excel 数据分析(Medium)— PASS

该层级表现最优。全部并发档成功率 100%,P95 最高 213.1 秒(低于 400 秒判定线),扩展性良好。需关注:64 路时长尾显著恶化(P99 302.9 秒、最大值 468.6 秒),吞吐回落至 8.19 次/分钟,不建议作为常态运行水位。

C成功率P50P95P99Max吞吐/min状态码判定
4100%119.3s128.8s128.8s147.4s1.63200×4PASS
8100%114.3s123.8s123.8s147.7s3.25200×8PASS
16100%102.3s133.9s133.9s187.2s5.13200×16PASS
32100%118.3s143.4s143.5s149.5s12.84200×32PASS
64100%167.6s213.1s302.9s468.6s8.19200×64PASS

5 多交付物重任务(Heavy)— FAIL

4 路全部成功(P95 309.6 秒);8 路出现首个失败(7/8,状态码 0)。自 16 路起发生级联中断:16 / 32 / 64 路共 112 个请求全部以状态码 0(连接失败)在 2–3 秒内被拒绝,成功率 0%,且三档测试间隔内服务均未恢复。

CHTTP OK完整交付成功率P50P95状态码判定
44/44/4100%228.5s309.6s200×4PASS
87/87/887.5%327.4s404.5s0×1, 200×7PASS
160/160/160.0%2.4s2.5s0×16FAIL
320/320/320.0%2.5s2.7s0×32FAIL
640/640/640.0%2.8s3.2s0×64FAIL
瓶颈判断
  • 严重 · 成功率坍塌:16 / 32 / 64 路成功率均为 0%,系统无法承载该并发。
  • 严重 · 连接拒绝:113/113 失败样本全部为状态码 0,2–3 秒内被拒绝,属服务端不可达而非超时。
  • 高 · 中断后无法自愈:三档持续失败,测试窗口内无恢复,缺少自动拉起机制。

6 结论与建议

轻量对话

安全水位不超过 32 路;64 路仅告警未失败,建议限流在 32–48 路。

Excel 分析

最佳工作点为 32 路(吞吐 12.84 次/分钟);64 路长尾过重,不建议作为常态水位。

重任务

当前仅能稳定承载 4 路(8 路已出现失败),16 路及以上发生服务中断。

建议
  • 对重任务实施入口限流或排队,将全局并发控制在 4–8 路以内;优先排查 113 例连接失败根因(内存耗尽、进程崩溃或网关熔断)。
  • 增加服务健康探针与中断后自动重启,避免 16 路之后持续不可用。
  • 轻载侧在网关设置 P95 超过 60 秒的弹性告警;如需支撑 64 路轻载,评估扩容推理副本。
  • 修复后按 8 / 12 / 16 路细粒度复测重任务层,验证中断边界与恢复能力。

数据来源:KunLand Performance Reports ×3(light 02:32 / medium 02:51 / heavy 03:07,2026-08-25)· 完整交付口径