$金山云(HK|03896)$  2025年8月19日发布都是DeepseekV3.1

1,这是混合推理模型,但还不具备多模态能

力。

2,从官方直接取消了r1来看,这个模型的智能上限至少应该很接近r1。昨晚有up测试,稳定性有一些改善,幻觉相比御三家还是很严重(在国内算最好的)。

3,目前看代码语法等基础能力没什么变化,整个v3.1模型的综合编码能力应该不下于

glm4.5,算国内编程单一模型顶级水平(之前的v3综合编程能力是不如k2和glm4.5两兄弟的)。qwen3走的分治的路子,一个235b think负责思考推理,另一个coder负责最基础的代码语法等。要两个模型配合才能发挥最好的效果。目前我是看好qwen3的路子的。ds和智谱的混搭路线就比较谨慎了。实际工作中,我也是一个高智能推理模型加上一个低智能代码模型一起用。此外还要看v3.1对工具调用的支持度怎么样,这对agent很重要。r1和v3都是没有工具调用能力的。cc上就用不了这两个模型。

4,原来r1的原生上下文窗口只有60多K,和k2一桌,现在翻倍到了128k,和原来的v3以及glm4.5一桌了。参数上不如qwen3系列

(256k),但也要看实际效果,因为上下文越长.所有模型的性能都会逐渐下降,不同模型下降程度不一样。而我记得deepseek有篇论文可以显著改善这个问题,这方面可以期待后续各自的评测。

5,从目前放出的初步测试来看,token消耗有了一定的降低,这对消费者来说是好事。我根据自己的使用情况估计了一下,agent时代,人均日耗20m是跑不了的,而且这还只是文本生成,不算信息量更大的图文和视频。

6,官方api调用还是走的原来v3的方式不变,而v3的价格只有r1的一半,相当于变相打5折了。这就比glm4.5还便宜了。qwen3要不是有免费渠道撑着,估计要被骂死了。

注:我之前对v4的期待就是非推理模型的硬智能干到glm4.5与r1之间的水平,目前看可能还不太现实。目前已知非推理模型硬智能最高的是k2,大概是glm4.5air的水平,但是缺点是上下文窗口只有64k。继续等大模型的发展吧。

追加内容

本文作者可以追加内容哦 !