位置:首页 > 技术资讯 > DeepSeek V4 Flash凭自验证超越Fable 5的关键原因

DeepSeek V4 Flash凭自验证超越Fable 5的关键原因

时间:2026-08-21  |  作者:火苗实验室  |  阅读:0

DeepSeek V4 Flash借助「自验证」技术,在Terminal-Bench 2.1上的成功率达到88%,超越了Fable 5,且单任务成本仅为0.11美元,不足后者的十分之一。

核心内容:

  • 自验证实现方式:对每个任务采样5条候选轨迹,由DeepSeek V4 Flash自身模型生成验证。
  • 实验结果:成功率为88%,超过Fable 5(成本约1.3美元),DeepSeek V4 Flash单任务成本约0.11美元。
  • 技术来源:斯坦福、UC Berkeley和NVIDIA Research团队提出的LLM-as-a-Verifier框架,通过更细粒度的验证和排序,从Agent的多次尝试中筛选更可靠的结果。该框架不仅可用于测试时扩展,验证信号还可用于进度跟踪和强化学习。

DeepSeek V4 Flash不换模型,只靠「自验证」反超Fable 5

成本更低,成功率接近并超越 Fable 5

把成功率拉到与 Fable 5 相近水平,DeepSeek 自验证单任务成本约 0.11 美元,不到后者的十分之一。

一个连自己都会答错的大模型,开始自己给自己挑答案了。

DeepSeek V4 Flash 在 Terminal-Bench 2.1 上,对每个任务采样 5 条候选轨迹。

自验证后的系统成功率达到 88%,超过 Claude Fable 5。

LLM-as-a-Verifier 框架概览

实验中,每个任务预先由 DeepSeek V4 Flash 生成 5 条 mini-swe-agent 执行轨迹。

  • Best-of-3 使用其中前 3 条。
  • Best-of-5 使用全部 5 条。

DeepSeek V4 Flash 同时负责给候选轨迹打分。

LLM-as-a-Verifier 据此完成排序和选择,整个过程不需要再训练一个专门的验证模型。

效果并不只是小幅涨点。

  • Best-of-3 将成功率从 79.4% 提到 86.5%。
  • Best-of-5 则把 78.7% 直接推到 88.0%。

放到 Terminal-Bench 2.1 的成本—性能图里,差距更加直观。

DeepSeek V4 Flash 自验证的成本与任务成功率

DeepSeek 一侧使用 DeepSeek V4 Flash Max,成本按当时的 OpenRouter 定价计算。

GPT-5.6 和 Claude 系列基线则沿用 GPT-5.6 技术报告中的结果。

上述成绩是系统级结果。

DeepSeek 一侧加入了多次采样和 LLM-as-a-Verifier,Fable 5 一侧使用 Claude Code,因此不能直接视为两个基础模型在相同条件下的单次横评。

DeepSeek V4 Flash 自验证结果

项目还公开了这组实验的候选执行轨迹,以及 Best-of-3、Best-of-5 对应的复现脚本。

Best-of-5 还有一个更关键的数字,Oracle(理想选择上限)达到 96.6%

它说明,对大量任务来说,5 条候选里已经至少出现了一条成功轨迹。

模型能够生成正确解,但验证器还没有把它们全部找出来。

原论文进一步汇总了 Terminal-Bench V2 排行榜中不同模型和 Agent 配置产生的执行轨迹。

理想选择器下的任务覆盖率最高达到 98.9%。

候选覆盖率与评分概率分布

验证扩展的三个维度

免责声明:文中图文均来自网络,如有侵权请联系删除,心愿游戏发布此文仅为传递信息,不代表心愿游戏认同其观点或证实其描述。

相关文章

更多

精选合集

更多

大家都在玩

热门话题

大家都在看

更多