Fireworks 千任务实测:Kimi K3 与 Fable 5 双模型路由达 93% 准确率,长 agent 循环成本降至 1/50

本站收录 2026-07-22 10:30信源发布 2026-07-21 00:00来源:Fireworks 官方博客 / Hacker News

Fireworks 发布实测报告《Kimi K3 is competitive with Fable; Kimi K3 + Fable is SoTA》,把开源旗舰 Kimi K3 与闭源旗舰 Fable 5 放进同一套 agent 评测 harness,共约 1,030 个真实任务,覆盖五类工作:SWE 真实仓库修 bug(460 题)、终端长程运维(安全/逆向/系统管理,89 题)、算法竞赛(100 题)、六语言实现(225 题)、律师评分的法律 agent 任务(120 题)。

核心结论有两个。其一,K3 作为开源模型已达到与 Fable 正面竞争的质量水位,且两者能力互补性稳定可预测;其二,用路由器在两个模型之间按任务分派,整体准确率达到 93%——高于任一单模型单独跑全程,同时在长 agent 循环场景成本最高可降至 Fable 5 单独使用的 约 1/50,且每一类工作负载下成本都一致更低。Fireworks 据此给出的判断是:单模型时代结束,“不要选模型,做路由”——异构模型组合才是新的 SoTA 配方。

需要注意的利益相关背景:Fireworks 是模型托管/推理服务商,K3 在其平台上的成本优势与其自身产品(路由、按量计费推理)直接相关,报告的实验设计虽给出了任务构成与对比口径,但成绩属厂商自报、未经独立第三方复现。不过这并不削弱其方向性信号——与昨日 Cursor 官博的 swarm 实验、上周的模型分工讨论放在一起看,“开源模型做主力 + 闭源旗舰做补位”的混合路线正在被多家头部工程团队用真实数据反复验证。

本文相关产品

已复制,可直接粘贴给你的 AI