内容提要
深度求索正在内测DS V4.1 Flash模型的中间版本,采用新结构,支持原生多模态,能力更强、速度更快、成本更低。内测用户调用速度可达300至600tok/s,但正式版可能无法达到此水平。该版本价格与V4 Flash相同,限流20并发,非内测用户也可尝试调用。
延伸解读
中间版本与正式版的差异
文章指出,DS V4.1 Flash的中间版本是训练中的新版本,仅限内测用户使用,并非最终版。其速度可达300至600tok/s,但作者认为正式版可能无法达到此水平,因为测试版可能部署在独立服务器上。这意味着内测用户能体验到更快的速度,但正式版可能更注重稳定性和成本控制,速度或有所下降。
调用方式与限制
有权限的用户可通过设置模型名称为deepseek-v4.1-flash-expires-on-0910来调用该中间版本,调用地址不变。价格与V4 Flash相同,但每个账号限流20并发,对多数开发者可能够用,若需更高并发则需搭配正式版。此外,非内测用户也可能直接调用,但未明确说明是否有限制。
成本与效率的权衡
中间版本在推理能力、多模态支持、速度和成本方面均有优势,但速度虽快,仍需计费。对于开发者而言,高速度可提升效率,但需注意并发限制和正式版可能的速度差异。选择中间版本或正式版需根据实际需求权衡,若追求极致速度且并发需求不高,可尝试内测版本。
Q&A
深度求索正在测试的DS V4.1 Flash中间版本是什么?
DS V4.1 Flash中间版本是深度求索正在内测的新模型版本,采用新的模型结构,支持原生多模态,能力更强、速度更快、成本更低。该版本目前仅限内测用户调用,但非内测用户也可以尝试调用。
DS V4.1 Flash中间版本相比V4 Flash有哪些改进?
DS V4.1 Flash中间版本采用新的模型结构,支持原生多模态,能力更强、速度更快、成本更低。
如何调用DS V4.1 Flash中间版本?
调用地址不变,只需将模型名称设置为deepseek-v4.1-flash-expires-on-0910即可调用。该版本价格与V4 Flash相同,每个账号限流20并发。
DS V4.1 Flash中间版本的响应速度有多快?
据内测用户分享,该模型响应速度最低也有300tok/s,最高能达到600tok/s。但这是单独部署的版本,正式版可能无法达到此速度。
DS V4.1 Flash中间版本是免费的吗?
不是免费的,该版本需要计费,但价格与V4 Flash相同。
DS V4.1 Flash中间版本是否对所有用户开放?
目前主要面向内测用户,但测试显示非内测用户也可以直接调用,有兴趣的用户可以尝试。