DeepSeek V4.1 Flash 更新后编程跑分亮眼,但聊天质量十天内下降约10分:创造力与连贯性下滑,截断率从13%升至34%,角色漂移、状态字段与RAG检索异常增多,重复检测失灵。原因是输入8B、输出16B的非对称架构偏向代码,牺牲了通用对话能力。建议编程场景继续使用,创作类任务改用其他模型或调高采样参数。
Deepseek-v3意外曝光,编程跑分超越Claude 3.5 Sonnet,成为最强开源LLM。该模型采用685B参数的MoE架构,支持64K上下文,完成率从17.8%提升至48.4%。在专家选择和训练效率上有显著改进,网友测试表现优异。
完成下面两步后,将自动完成登录并继续当前操作。