JetBrains因AI开发费用半年增长约10倍,开发了JetBrains Central CLI工具来控制成本。该工具支持认证、自动检测代理、通过AI路由层应用令牌预算,并允许管理者设置细粒度限制和查看报告。内部推出后迅速被上千名开发者采用,现已开放早期访问,旨在平衡开发者自由与成本治理。
本文介绍如何通过“令牌预算感知推理”降低AI推理成本。核心方法包括:在提示中设定推理令牌预算(如TALE技术),使用简洁思维链,以及架构级优化——语义缓存(如Redis LangCache)减少重复查询,复杂度路由将简单问题分配给便宜模型,持久化代理记忆避免重复推理。这些手段可显著节省输出令牌费用,提升响应速度。
本研究提出了AnytimeReasoner框架,旨在提高大型语言模型的推理效率。通过优化令牌预算,显著提升了训练和令牌效率,实验证明其在数学推理任务中优于现有技术。
本研究提出了一种动态估计令牌预算的推理框架,旨在提高大语言模型的令牌使用效率,降低成本,并在仅轻微影响性能的情况下实现效率与准确性的平衡。
完成下面两步后,将自动完成登录并继续当前操作。