本文讨论LLM推理延迟的复杂性,指出其分为首字延迟、总响应时间和代理全链路时间等指标,受队列、防护、冷启动及RAG检索影响。优化需按场景选择指标:聊天重首字,代理重总耗时,批处理重成本。语义缓存可跳过模型调用,显著降延迟和成本,Redis Iris等工具支持此优化。
本文讨论了“准则崩溃”的概念,即在优化一个指标时,可能会导致另一个指标达到最优。研究发现在不同学习标准下,错误概率最小化的崩溃条件,包括CVaR、倾斜ERM等风险。通过非单调标准的升降式算法,展示了在具有伯努利分布损失的情况下的崩溃现象。同时,研究还发现倾斜ERM等单调准则无法避免崩溃现象,而非单调的替代准则可以避免。
完成下面两步后,将自动完成登录并继续当前操作。