3万亿参数 Code 2.0 被指即将发布,性能预计击败 Mythos 5.1 与 GPT-6 Astra。V4.1 Flash 架构大改堪比 V5,V4.1 Pro 也已确定。
快科技 9 月 13 日消息,DeepSeek 近期动作频繁,V4.1 Flash 架构大改、V4.1 Pro 确定、Code 2.0 即将发布,以下为核心看点。
本周发布,架构变化之大完全可以称得上是 V5,但 DeepSeek 很低调地没换大版本号。
Pro 系列新品已确定,具体升级尚未公布。考虑到 V4 Pro-0813 的不及预期,期待值不要拉太高。
爆料者称时间窗口是 9 月份,预计性能会击败 Mythos 5.1 和 GPT-6 Astra,当前最强大的两个前沿级大模型。
Code 2.0 拥有高达 3万亿以上参数量,这是它提高性能的关键,远超国内其他主流大模型。
想跟 Mythos 5.1 及 Astra 竞争就需要这个级别的参数量,不然性能上限很难提升。
设计重点是电脑控制,AI 替代你操作电脑完成很多工作,Astra 很多让人惊讶的使用就来自这一方面。
围绕 V4.1 系列与 Code 2.0 的爆料,有几个关键点值得关注。
V4.1 Flash 换用新结构,使得参数量翻倍,架构变化之大堪比 V5,但官方低调处理版本号。
DeepSeek Code 2.0 预计会继续保持开源开放,延续 DeepSeek 一贯的开放路线。
从 V4.1 Flash 参数翻倍来看,Code 2.0 从 1.6万亿提升到 3万亿参数的可信度是有的。
重推偏向代码/逻辑的 Code 大模型,作为旗舰级产品是一个方向,V4.1 Pro 及 Flash 面向通用 Agent 任务。
Code 2.0 预计击败 Mythos 5.1 和 GPT-6 Astra,这两个是当前最强大的前沿级大模型。
3万亿以上参数量,K3 是 2.8万亿,Qwen 3.8 Max 是 2.4万亿,DeepSeek V4 Pro 是 1.6万亿。
设计重点是 Computer Use,AI 替代你操作电脑完成很多工作,这是当前前沿方向。
“DeepSeek 下一波大模型被指即将问世:3万亿参数,性能超 GPT-6 Astra。”
本次爆料可信度尚待验证,DeepSeek 过去 23-24 年曾推出过三款带 Code 的大模型,表现平平,这次能否翻身值得关注。