
8月21日明珠国际,业界千呼万唤的R2模型没来,但DeepSeek官方正式发布了新模型V3.1。从命名来看这或许不是一次大的版本更新,更像是前一代DeepSeek-V3模型的小版本迭代。
在X上,DeepSeek将V3.1称为“我们迈向智能体时代的第一步”(ourfirststeptowardtheagentera)。本次升级主要有三大亮点,其中包括更强的Agent能力、混合思考模式和更高的思考效率。
官方表示,通过后训练优化,新模型在工具使用与智能体任务中的表现有较大提升。在编程智能体、搜索智能体测评中,V3.1相比之前的DeepSeek系列模型都有明显提高。

DeepSeek-V3.1是混合推理架构,一个模型同时支持思考模式和非思考模式。目前用户可在官方App与网页端体验新模型,通过“深度思考”按钮明珠国际,实现思考模式与非思考模式的自由切换。DeepSeekAPI也已同步升级,deepseek-chat对应非思考模式,deepseek-reasoner对应思考模式,且上下文均已扩展为128K。
“混合推理非常棒。拥有一个能够在深度思考和快速响应之间切换的模型,感觉就像是实用人工智能的未来。”X上有网友表示,“在深度推理和快速反应之间切换真是天才之举。”根据查询调整深度,可以避免在简单任务上过度耗时,同时在需要时进行全面分析。
与之前的版本相比,V3.1也有更高的思考效率。官方表示,DeepSeek-V3.1-Think在保持与DeepSeek-R1-0528相当的答案质量的同时,响应速度更快。
官方测试结果显示,经过思维链压缩训练后,V3.1-Think在输出token数减少20%-50%的情况下,各项任务的平均表现与R1-0528持平。

同时,V3.1在非思考模式下的输出长度也得到了有效控制,相比于DeepSeek-V3-0324,能够在输出长度明显减少的情况下保持相同的模型性能。
同步地,DeepSeek进行了价格调整,模型的API接口调用价格有所上涨。自9月6日凌晨起,取消夜间时段优惠,输入价格上,缓存命中时为0.5元/百万tokens,缓存未命中的价格则为4元/百万tokens(此前V3为2元/百万tokens);输出价格为12元/百万tokens(此前V3为8元/百万tokens)。

官方提到,V3.1的基础模型在V3的基础上重新做了外扩训练,一共增加训练了840Btokens。基础模型与后训练模型均已在Huggingface与魔搭开源。
值得一提的是,DeepSeek此次还宣布增加了对海外模型AnthropicAPI格式的支持明珠国际,官方提到这是“为了满足大家对AnthoripicAPI生态的使用需求”,用户可以将DeepSeek-V3.1的能力接入ClaudeCode框架。
一鼎盈提示:文章来自网络,不代表本站观点。