算力舱AI模型适配实录

💡 原文中文,约600字,阅读约需2分钟。
📝

内容提要

文章介绍了通过两台协同计算优化AI模型,实现稳定70 TPS和382K上下文,并利用DFlash2优化稠密模型达到单流125-133 TPS、8并发231 TPS,通过YaRN技术将上下文扩展至900K。同时对比了n-gram和MTP方案,最终选择MTP实现60 TPS和2232 TPS Prefill,适合日常写代码,并计划继续优化其他模型。

🏷️

标签

➡️

继续阅读