多智能体并行虽高效,但每个智能体需独立上下文,重复阅读文件导致token成本高。自查不可靠,需独立质检。任务书应自包含且窄,验收独立派人,能串行则不并行。核心判据:任务拆分后所需背景越少越适合并行,否则协作成本高,无人掌握全局最贵。
AI应用面临高token成本导致毛利低甚至为负的问题,如Perplexity、Cursor等公司毛利率不佳,创业公司“越增长越接近死亡”。陶哲轩新书《数学六大核心概念》强调AI与人类能力互补,但AI存在ROI不透明、忽略问题难度等不足。
文章讨论AI编程工具中常驻上下文与按需加载的token成本问题。常驻位包括规矩文件链、导入文件、规则、自动记忆和工具定义,每次开工都收费;按需加载如skill仅描述常驻,正文触发才读。判断标准是使用频率,而非重要性。建议用/context检查实际加载清单,避免浪费token。
本文介绍如何通过优化提示缓存来降低LLM API的token成本。提示缓存可复用已计算的KV缓存,避免重复预填充,从而减少费用和延迟。优化要点包括:保持系统提示(工具和技能定义)不变、会话中不修改工具或模型、利用会话压缩控制历史长度,并注意缓存失效和压缩成本。
本文对比AI编程工具OpenCode与Reasonix,指出Reasonix通过缓存机制大幅降低token成本,测试中0.45美元可处理9000万token,是OpenCode的3.6倍,但依赖重复查询场景。文章提醒用户可能被计费规则影响提问方式,而本地部署虽不划算但提供控制感,最终强调选择工具应基于使用习惯,避免被算法定义。
高仿Manus的开源软件Suna在Github Trending榜首,开发者在3周内完成。项目需高token成本,普通用户难以承担。Suna旨在以低成本让用户体验AI产品,推动AI应用发展。
完成下面两步后,将自动完成登录并继续当前操作。