本文介绍LLM Wiki在企业合规知识问答中的实践,面临三道坎:并发编译导致38%页面重复,通过串行规划解决;目录摘要有损压缩导致查询遗漏,用BM25全文检索补充,命中率从70%提升至92.7%;人工修正被重编译覆盖,用语义pin保存修正意图。最终强调LLM Wiki适合少而精的知识,非RAG替代品。
本文介绍如何确保语言模型输出可靠的结构化数据。核心方法包括:用工具调用和JSON模式约束输出,先设计Schema而非提示词,区分语法、结构和语义错误,构建带本地修复和重试的循环,以及处理无法重试的失败。建议字段设为可空而非可选,并跟踪每次成功提取的尝试次数作为关键指标。
本文介绍微软首席应用科学家Mariko Wakabayashi和高级应用科学家Zixiao Chen,他们专注于开发网络安全运营的智能体AI工作流,研究LLM驱动系统、智能体工作流及前沿AI应用,并涉及秘密检测、智能体安全系统及LLM微调,旨在提升AI效率、可扩展性和实际部署能力。
该文章介绍了多个AI模型的API配置,包括Kimi、DeepSeek和小米MiMo。Kimi提供K3和K2.7代码模型,支持工具调用、视觉和长上下文;DeepSeek提供V4系列,支持长输入输出;小米MiMo提供V2.5系列,涵盖文本、视觉、语音识别和语音合成等功能。
作者利用LLM制作工具,为图标库补充颜色元数据。该工具通过HSV色相直方图分析未标记图标,生成HTML页面,左侧列出颜色,右侧分为“已标记”和“可能缺失”两栏。作者手动选择后复制ID,让LLM更新元数据。此方法高效,LLM擅长生成一次性代码,工具简单(HTML/CSS/JS),作者掌控视觉决策,避免盲目信任。
该研究证明,一条事实错误的针对性论证足以让大语言模型放弃正确答案。通过GRPO强化学习训练说服模型,Qwen-2.5-7B在TruthfulQA上的准确率从66.2%骤降至1.8%。该策略可跨模型迁移,对Qwen-14B和Llama-3.1-8B的PSR均超79%。闭源模型如GPT-5-mini更抗说服,但现有防御仍不充分,PBT-8B的PSR仍达60%。
LLM使编程语言选择不再重要,开发者可借助AI使用不熟悉的语言(如Rust、Zig)构建快速小型软件。这推动了更多人对性能的追求,并涉足DWARF、eBPF等复杂技术,尽管可能产生更多“垃圾代码”,但也扩大了开发者群体。
Rust官方通过4200份问卷和70余次访谈发现,学习Rust的真正难点并非语法,而是摆脱旧语言思维习惯。编译器报错信息是有效学习工具,LLM正降低学习门槛。企业培养Rust团队有成熟路径,但存在“静默流失”现象,社区氛围影响新人留存。
AI提升效率,但带来空洞与焦虑。Vibe coding快速实现想法,却削弱思考;LLM即时回应,缺乏深度。焦虑源于能力下滑、竞争加剧及被替代风险。解法在于适应技术,如蒸汽机时代,驾驭而非对抗,同时警惕效率提升不解决竞争,需持续努力。
Stripe确认以约80亿美元收购AI模型路由平台OpenRouter,为其最大收购。OpenRouter通过统一API连接数百个模型,优化成本与性能,日处理超10万亿token。Stripe旨在整合AI“token经济学”,帮助企业管理AI推理成本,提升盈利。OpenRouter保持品牌独立,交易反映AI成本管理成为企业核心需求。
论文提出BayesBeliefAgent,针对多智能体系统中伙伴中途换策略而智能体反应迟缓的问题,结合GPT-4o规划器与贝叶斯追踪,仅在动作与推断技能矛盾时触发重规划。在Overcooked基准上,该法将信念-行动差距从0.41降至0.20,重规划次数减少20-80倍,但Forced Coordination布局收益有限。
本文总结了IT领导者使用可观测性监控AI应用的七条经验:从MVP阶段就纳入LLM可观测性,避免“测量债务”;用非确定性指标监控概率系统;采用标准遥测词汇;让仪表报告已知数据;控制遥测成本;识别数据而非模型问题;以及成本可见性不等于质量保证。核心是尽早测量,以证明AI价值。
本教程介绍如何使用vLLM扩展AI代理的LLM推理。文章解释了LLM推理的预填充和解码阶段,以及AI代理工作负载为何难以服务。vLLM通过连续批处理、PagedAttention和前缀缓存优化并发推理。教程演示了在本地安装vLLM、启动服务器,并通过OpenAI兼容API连接AI代理的步骤,最后讨论了这些优化技术的重要性及适用场景。
本文介绍LLM API调用工程化实践:需权衡延迟、质量、成本与数据合规,选择合适访问模式;通过提示缓存和语义缓存降低成本,用指数退避处理限流,并以外置会话存储弥补API无状态缺陷。Redis Iris提供语义缓存、代理记忆等托管服务,构建AI上下文层,优化调用性能与成本。
LLM使计算机从精确指令转向理解模糊意图,但也带来更多意外后果。未来需区分专业与业余:专业人士应具备预见性,减少软件对日常生活的负面影响,避免“Oops,早该想到”的失误。
Expedia Group has open-sourced mockql-rs, a Rust CLI that fills @mock-annotated GraphQL fields with LLM-generated data at request time. It follows Airbnb's @generateMock in April and a GraphQL...
LLM预测可替代人类进行A/B测试,但需满足替代性和可比性假设。在Upworthy数据集中,校准LLM输出可恢复治疗效果,但线性校准失败,机器学习方法更有效。新治疗越偏离历史数据,假设越不可验证,LLM优势与风险并存。人类实验仍不可或缺,LLM可辅助筛选和降方差,但不能完全替代。
PromptCache是一个用Go编写的LLM语义缓存网关,通过向量相似度双阈值判定(高阈值直接命中、低阈值未命中、灰区用廉价模型仲裁)缓存重复请求,支持OpenAI兼容接口、多提供商热切换和持久化存储。它降低token成本和延迟,但存在语义误判、忽略上下文、多租户隔离不足及暴力扫描性能瓶颈等风险。
本文总结了Airbnb、Netflix、Lyft和Uber如何将因果推断应用于LLM功能测量。核心要点:根据部署机制选择方法(如DiD、RDD、AIPW),运行诊断验证假设,将短期指标与长期价值关联,并让因果估计支持前瞻性决策。强调提前埋点、匹配方法与场景、避免混淆数据,以可靠评估AI功能真实影响。
本文介绍双重稳健估计(AIPW)在AI产品因果推断中的应用。针对用户自选加入导致的偏差,AIPW结合倾向得分和结果模型,只要其中一个正确即可获得一致估计。通过Python实现和模拟数据验证,AIPW能纠正选择偏差,恢复真实效应(+8%),并展示模型误设时的稳健性,同时讨论其局限和实际应用策略。
完成下面两步后,将自动完成登录并继续当前操作。