清华系团队发布国产Token优化工厂:兼容10余种国产芯片,日吞吐千亿Token
内容提要
石科技在WAIC 2026发布拓元(Vectron),旨在解决中国算力浪费问题。通过统一调度10余种国产芯片、优化推理效率,提升算力利用率,降低企业AI成本。拓元具备KV Cache压缩、Token压缩等技术,推动AI基础设施从规模竞赛转向效率竞赛,释放万亿级算力价值。
延伸解读
效率竞赛:从规模到效能的转折点
文章指出,中国已建成50多个智算中心,智能算力总规模超1000 EFLOPS,但平均利用效率仍有巨大提升空间。这反映出行业正从“算力规模竞赛”转向“算力效率竞赛”。拓元的发布正是这一趋势的体现,其核心目标是通过优化调度和推理效率,将闲置算力转化为实际可用的Token,从而降低企业AI应用成本。
异构算力统一调度:国产芯片生态的关键拼图
拓元兼容昇腾、昆仑芯、天数智芯等10余种国产芯片,适配20余个主流模型,实现统一调度与推理加速。这解决了国产芯片生态适配成本高昂、异构算力难以统一管理的痛点。对于企业而言,这意味着无需绑定特定芯片,即可灵活利用现有算力资源,降低迁移和运维成本,是国产算力走向“好用”的重要中间件。
技术突破直击长上下文与多模态成本痛点
文章重点介绍了拓元的多项技术,如结果感知驱动的KV Cache压缩、模态自适应的免训练Token压缩等。这些技术旨在解决长上下文带来的显存压力和多模态场景下的计算冗余问题,使长文本和大规模AI应用能够更经济地运行。这反映了当前大模型落地中成本高企的现实,而效率优化成为释放算力价值的关键路径。
Q&A
拓元(Vectron)是什么?
拓元(Vectron)是是石科技在WAIC 2026上发布的国产Token优化工厂,旨在解决中国算力浪费问题,通过统一调度10余种国产芯片、优化推理效率,提升算力利用率,降低企业AI成本。
拓元兼容哪些国产芯片?
拓元全面兼容昇腾、昆仑芯、天数智芯、太初、瀚博半导体、摩尔线程、沐曦、燧原等10余种国产算力芯片,并适配20余个主流模型。
拓元如何提升算力利用效率?
拓元通过任务自适应优化、KV Cache压缩、Token压缩、长上下文优化等技术,实现算力按需分配、减少资源浪费,从而提升算力利用效率。
拓元的核心技术有哪些?
拓元的核心技术包括:结果感知驱动KV Cache压缩、基于模态自适应的免训练Token压缩、混合位置索引合成的长上下文偏好训练、基于元奖励的可扩展奖励建模,以及目标导向的信息记忆策略。
拓元如何降低企业使用大模型的成本?
拓元通过KV Cache压缩降低显存压力,通过Token压缩减少计算量,通过元奖励建模减少人工反馈需求,从而降低企业部署和运行大模型的成本。
拓元在长上下文处理方面有什么优势?
拓元通过混合位置索引合成的长上下文偏好训练方法和记忆引导的重读机制,在远小于同类方法的训练数据量下实现显著效果提升,支持超长记忆能力。
拓元如何实现异构算力的统一调度?
拓元通过兼容多种国产芯片,构建统一的调度平台,屏蔽底层差异,实现异构算力池的统一管理和优化调度,使不同芯片协同工作。
拓元对AI基础设施竞争格局有什么影响?
拓元的发布标志着AI基础设施竞争从算力规模竞赛转向算力效率竞赛,推动行业从单纯堆砌芯片转向优化算力利用效率,释放万亿级算力价值。