参数不再越大越好,DeepSeek V4带来端侧AI的第二次想象
过去几年,大模型行业形成了一条看似清晰的增长公式:参数越多、训练数据越大、算力投入越高,模型能力就越强。科技公司围绕GPU集群、训练Token和参数规模展开军备竞赛,行业也习惯用服务器数量和算力建设规模衡量AI的进展。
但DeepSeek提示了另一种可能:模型竞争的重点,正在从“拥有多少参数”转向“每次推理真正调用多少参数,以及如何让这些参数更有效地工作”。7月31日,DeepSeek-V4-Flash正式版API上线公测。模型没有继续“增肥”,结构和尺寸也与4月发布的预览版保持一致,仅通过重新后训练,Agent、代码生成和工具调用能力便出现明显跃升。
DeepSeek-V4-Flash并不是传统意义上的小模型。公开资料显示,其总参数量约为284B,即2840亿,但采用混合专家架构,每次推理激活参数约为13B。它更像一个拥有庞大专业团队的组织,知识储备足够丰富,处理具体任务时却只调动最合适的一部分专家。13B激活参数撬动高性能,由此成为观察端侧AI未来的一扇窗口。
端侧设备不可能复制数据中心的算力规模,却可以借鉴这种效率思路。稀疏激活降低单次计算负担,蒸馏把大模型能力迁移给更小模型,量化继续压缩内存和功耗,再由端云协同分配复杂任务。V4的意义并非给出了一部可以立即运行完整模型的手机,而是让“高性能模型如何向终端迁移”从单纯依赖芯片升级,变成模型、硬件和系统共同优化的问题。
从堆参数到练能力:模型效率成为新标尺
大模型行业曾经迷信一个朴素规律:规模就是能力。GPT-3之后,参数规模迅速成为衡量模型先进程度的标签,企业不断扩建计算集群,希望通过增加参数和训练投入逼近更高的智能上限。
这种路径确实有效,但代价也越来越高。参数增加不仅意味着训练时需要更多GPU、电力和数据,也意味着推理阶段面临更高的显存占用、时延和调用成本。模型越庞大,就越难离开数据中心,更难进入手机、汽车、机器人和可穿戴设备等资源受限的终端。
DeepSeek V4的价值,在于它把行业关注点从模型的“体重”拉回了模型的“工作效率”。V4-Flash正式版与4月发布的预览版本保持相同的模型结构和尺寸,能力提升主要来自后训练。所谓后训练,是在基础模型完成大规模预训练之后,通过强化学习、任务数据和反馈机制,让模型更擅长拆解任务、调用工具和完成复杂工作。
这意味着,模型能力的进步未必需要继续无限扩大参数规模。同样一副“骨架”,经过更有效的训练,也可以获得更强的推理和执行能力。模型行业由此可能从“算力投入决定一切”,转向架构、数据质量、训练方法和软硬件协同共同决定效率。
混合专家架构是其中的重要基础。它类似于一家拥有大量专业部门的公司:面对代码问题时,主要调用编程专家;面对数学任务时,则由更擅长推理的模块参与。全部专家都存在于模型中,但每次只激活其中一部分,既保留了大模型的能力上限,又降低了单次推理的计算负担。
更深层的变化来自推理成本。模型能力越来越接近后,决定AI能否大规模落地的,不再只是排行榜上的分数,而是完成一次任务需要多少算力、多少时间和多少费用。如果一个模型可以用更少的激活参数和更低的计算量完成相同任务,企业部署AI Agent、智能客服、代码助手和办公工具的经济账就会被重新计算。
不过,“模型效率提升”并不等于算力需求消失。单次调用成本下降后,AI使用频率、用户数量和任务复杂度往往同步上升,最终可能形成类似移动互联网流量的杰文斯悖论:单位成本越低,总消耗反而越大。受冲击的更可能是缺乏差异化、单纯按算力资源赚取价差的服务模式,而不是具备芯片、互联、存储和软件生态能力的核心基础设施。
从云端问答到终端Agent:端侧AI寻找第二条路径
端侧AI的第一次想象,来自生成式AI进入手机和电脑。2023年以来,芯片厂商和终端品牌密集推出AI手机、AI PC,各类设备开始具备摘要、翻译、修图和文档生成能力。但不少所谓端侧AI仍然是“云端模型的遥控器”:设备负责收集指令,真正复杂的计算仍在数据中心完成。
问题在于,云端模式难以覆盖所有场景。个人相册、聊天记录、企业文件和车内数据涉及隐私,不适合长期上传;实时翻译、机器人控制和智能座舱要求极低时延,也无法完全依赖网络;持续调用云端模型还意味着额外费用和功耗。因此,真正成熟的AI终端必须具备一定的本地推理能力。
V4带来的第二次想象,不是把284B模型原封不动塞进手机,而是沿着“稀疏激活—模型蒸馏—低精度量化—端云协同”的路径,把大模型能力逐步迁移到终端。蒸馏是让小模型学习大模型的推理方式,量化则是降低模型计算精度,以更少内存和功耗完成推理。终端小模型负责高频、隐私和低时延任务,云端大模型处理复杂推理,两者之间动态分工。
这种模式可能改变AI硬件的竞争标准。过去智能手机比拼CPU主频、摄像头像素和屏幕参数,未来更重要的指标将是NPU算力、内存带宽、存储容量、散热能力以及模型与操作系统的协同效率。AI PC、智能汽车、机器人和耳机也将面临相似变化:硬件不只是运行应用,而是持续理解用户、调度工具并执行任务。
这种变化会沿着硬件链条逐层传导。模型常驻终端,对存储容量和内存带宽提出更高要求,兆易创新(603986)、北京君正(300223)、江波龙(301308)、佰维存储等企业所处的存储环节,业务变量将更多地与AI终端的配置升级联系在一起。瑞芯微(603893)、晶晨股份、全志科技(300458)、恒玄科技、乐鑫科技等SoC厂商,则分别覆盖智能硬件、机顶盒、可穿戴设备和AIoT场景,NPU性能、功耗控制和软件工具链会成为产品竞争力的重要组成部分。
模型在本地持续运行,还会抬高终端的功耗与热密度。华勤技术(603296)、工业富联(601138)等ODM厂商需要重新平衡主板、电池与散热空间,中石科技(300684)、飞荣达(300602)、领益智造(002600)等企业所涉及的散热材料和结构件,也将面对更复杂的终端设计需求。这里讨论的是端侧AI对现有业务链条的潜在影响,并不代表相关企业已经取得DeepSeek V4订单,更不能只凭“适配”公告判断产业进度。
判断端侧AI是否走出技术演示,关键要看产品端的真实变化。终端品牌需要把本地AI从影像、语音等单点功能,推进到跨应用理解和执行任务;SoC的NPU算力提升,还要得到内存规格、开发工具和操作系统的配合;存储、散热和结构件厂商的经营数据,则应逐渐反映出高端产品占比、单机用量或客户需求的变化。只有这些变化互相印证,模型效率才算真正转化为产业需求。
现实约束同样存在。小模型处理复杂推理、长上下文和多工具协作时仍有能力差距,量化与蒸馏也可能带来精度损失;终端厂商还要在续航、散热、隐私合规和系统兼容之间寻找平衡。因此,未来较长一段时间,端云协同更可能成为主流:本地模型处理高频、私密和低时延任务,云端模型承担更复杂的计算,两者根据场景动态切换。
参数不再越大越好,并不意味着大模型时代结束,而是大模型开始从追求“更大”走向追求“更有效”。DeepSeek V4以较低的激活量撬动高性能,让端侧AI看到了一条不同于堆算力的路径。它指向的也不只是手机多出几个生成式功能,而是终端逐渐成为能够理解用户、保护隐私并主动完成任务的本地Agent。端侧AI的第二次想象,真正取决于模型效率能否被转化成更流畅的产品体验,以及可持续的硬件与软件需求。
所有文章未经授权禁止转载、摘编、复制或建立镜像,违规转载法律必究。
举报邮箱:1002263188@qq.com