欢迎您访问欢迎来到沄森网,沄森智能旗下资讯平台!今天是:2026年08月03日 星期一 农历:丙午(马)年-六月-廿一
您现在的位置是:首页 > 热点

DeepSeek又发重磅更新 后训练提升模型能力

创始人2026-08-02 22:31:44
后训练正成为大模型能力提升的新变量。DeepSeek 最近更新了 DeepSeek-V4-Flash,官方称之为“正式版”,但目前仅在 API 端上线公测

后训练正成为大模型能力提升的新变量。DeepSeek 最近更新了 DeepSeek-V4-Flash,官方称之为“正式版”,但目前仅在 API 端上线公测。此次更新只涉及 deepseek-v4-flash,V4-Pro API 以及 App 和网页端当前使用的模型并未随之更新。

DeepSeek又发重磅更新

值得注意的是,DeepSeek-V4-Flash-0731 与此前的 Preview 版本采用相同的模型结构和参数规模,只是重新进行了后训练。这引发了人们的疑问:没有换架构,为什么能力还能提升?

DeepSeek又发重磅更新 后训练提升模型能力

大模型的训练可以简单分为两个阶段。首先是预训练,模型通过大量文本和代码学习知识,形成基础能力。其次是后训练,这是针对具体工作的专项训练,让模型学会如何回答问题、调用工具以及按要求完成任务。这次 DeepSeek 没有重新设计模型架构或扩大参数规模,而是在原有模型上重新进行后训练,导致内部权重和行为方式发生变化。

DeepSeek又发重磅更新 后训练提升模型能力

这种变化类似于同一辆车未更换发动机,却重新调整了变速箱、控制系统和驾驶策略。车本身没有变大,但在特定道路上的表现可能明显改善。不过,DeepSeek 并未公布具体的后训练数据、奖励方法和训练流程,因此无法进一步断言性能提升究竟来自哪一种技术。

新版 V4-Flash 在 Terminal Bench 2.1 上获得 82.7,在 DeepSWE 上获得 54.4,在 DSBench-FullStack 上获得 68.7。这些测试不同于传统代码补全,它们要求模型进入一个工作环境,读取文件、理解代码仓库、调用终端、修改程序、运行测试,并根据报错继续处理。这意味着模型不仅要知道答案,还要连续完成多个步骤。

所有文章未经授权禁止转载、摘编、复制或建立镜像,违规转载法律必究。

举报邮箱:1002263188@qq.com