DeepSeek发布Prover-V2模型,参数量达6710亿

BlockBeats 消息,4 月 30 日,DeepSeek 今日于 AI 开源社区 Hugging Face 上发布了一个名为 DeepSeek-Prover-V2-671B 的新模型。据悉,DeepSeek-Prover-V2-671B 使用了更高效的 safetensors 文件格式,并支持多种计算精度,方便模型更快、更省资源地训练和部署,参数达 6710 亿,或为去年发布的 Prover-V1.5 数学模型升级版本。在模型架构上,该模型使用了 DeepSeek-V3 架构,采用 MoE(混合专家)模式,具有 61 层 Transformer 层,7168 维隐藏层。同时支持超长上下文,最大位置嵌入达 16.38 万,使其能处理复杂的数学证明,并且采用了 FP8 量化,可通过量化技术减小模型大小,提高推理效率。(金十)

声明:本文所述观点不代表沐林数字货币安全教育网立场,文章内容仅供学习、阅读和参考。对购买、持有或出售任何数字资产不提供观点。投资存在风险,请自行评估。转载需注明来源,违者必究!

相关推荐

美方多渠道主动接触中方希望谈关税,显现急于推动谈判心理

BlockBeats 消息,5 月 1 日,从消息人士处获悉,近一段时间,美方通过多种渠道主动与中方…

特朗普呼吁国会通过美国史上最大减税措施,称将短期实现GDP增长3.3至3.8%

BlockBeats 消息,5 月 1 日,据美国白宫官方公告,特朗普总统再次呼吁国会通过的「又大又…

特朗普向马斯克表示:你可以想待多久就待多久

BlockBeats 消息,5 月 1 日,美国总统特朗普向马斯克表示:「你可以想待多久就待多久。」…