➡️
继续阅读
-
【vLLM 学习】Eagle
vLLM 是加速大语言模型推理的框架,实现KV缓存零浪费。文章提供Helm图表部署配置及EAGLE投机解码示例,通过离线推理脚本展示如何用vLLM加载模型...
-
面向语音与实时智能体的最低延迟推理 API:一份以首 Token 时间(TTFT)为先的基准测试
本文探讨语音智能体延迟指标,指出TTFT(首Token时间)仅是起点,真正影响体验的是TTFS(首句时间)。文章基准测试了LLM、STT、TTS及语音到语...
-
让炼丹更科学一些(八):多阶段训练的学习率
上篇文章《让炼丹更科学一些(七):步长调度与权重平均》我们简单介绍了无调度(Schedule-Free)学习率的工作,它试图通过某种权重平均来替代学习率调...
-
Claude Code vs Codex 记忆体系深度对比
Claude Code —— 分层自动记忆系统四层分层架构(CLAUDE.md / Auto Memory / Session Memory / Auto...
-
Codex正在放弃上下文压缩机制 改为通过历史记录和持久笔记继续任务
#人工智能 近期合并的 PR 显示,Codex 正在放弃上下文压缩机制,改为通过历史记录和持久笔记继续任务。Codex 新增历史和笔记工具,而模型觉得旧内...
-
语音 AI vs IVR:差距比大多数企业意识到的更大
几十年来,交互式语音应答(IVR)一直是处理海量来电的行业标准。它的设计初衷只有一个:在来电者接通人工坐席之前,将其分流到预设的分类桶中,从而为联络中心挡...