Expedia Group has open-sourced mockql-rs, a Rust CLI that fills @mock-annotated GraphQL fields with LLM-generated data at request time. It follows Airbnb's @generateMock in April and a GraphQL...
LLM预测可替代人类进行A/B测试,但需满足替代性和可比性假设。在Upworthy数据集中,校准LLM输出可恢复治疗效果,但线性校准失败,机器学习方法更有效。新治疗越偏离历史数据,假设越不可验证,LLM优势与风险并存。人类实验仍不可或缺,LLM可辅助筛选和降方差,但不能完全替代。
PromptCache是一个用Go编写的LLM语义缓存网关,通过向量相似度双阈值判定(高阈值直接命中、低阈值未命中、灰区用廉价模型仲裁)缓存重复请求,支持OpenAI兼容接口、多提供商热切换和持久化存储。它降低token成本和延迟,但存在语义误判、忽略上下文、多租户隔离不足及暴力扫描性能瓶颈等风险。
本文总结了Airbnb、Netflix、Lyft和Uber如何将因果推断应用于LLM功能测量。核心要点:根据部署机制选择方法(如DiD、RDD、AIPW),运行诊断验证假设,将短期指标与长期价值关联,并让因果估计支持前瞻性决策。强调提前埋点、匹配方法与场景、避免混淆数据,以可靠评估AI功能真实影响。
本文介绍双重稳健估计(AIPW)在AI产品因果推断中的应用。针对用户自选加入导致的偏差,AIPW结合倾向得分和结果模型,只要其中一个正确即可获得一致估计。通过Python实现和模拟数据验证,AIPW能纠正选择偏差,恢复真实效应(+8%),并展示模型误设时的稳健性,同时讨论其局限和实际应用策略。
本文介绍AI评估工程,强调仅靠演示和直觉开发AI系统不可靠。核心是采用评估驱动开发,通过三层架构(离线数据集评估、CI/CD门禁、生产监控)系统化评估RAG和智能体系统。重点包括构建黄金数据集、使用六项RAG指标、校准LLM评判器,并持续从生产故障中学习,以保障系统质量。
文章探讨了LLM对个人能力的影响,指出过去人们通过搜索和思考构建理解与行动力,而如今依赖LLM虽便捷高效,却削弱了自身成长,如同不再自己修车,导致依赖加深,丧失独立维护和创新能力。核心观点是过度使用LLM会阻碍个人能力发展。
本文介绍五门免费课程,帮助不同水平的人学习现代AI和LLM,涵盖工作应用、AI编程、LLM深度技术、RAG应用开发及Hugging Face工具。强调学习AI无需昂贵费用,可利用免费资源、GPU和API,通过实践构建项目来掌握技能,而非仅看视频。
哈佛大学等团队提出PG-LLM基准测试,首次统一评估13款通用语言模型与95种专业蛋白质预测工具。结果显示,Claude Opus 5等通用模型在蛋白突变排序上超越半数专业工具,但落后于顶尖模型VenusREM。研究揭示通用模型随推理资源增加性能提升有限,且对候选集规模敏感,为蛋白质工程工具选择与融合提供新思路。
本文比较了Redis与专用向量数据库(如Pinecone、Milvus、Qdrant)及pgvector的优劣。Redis作为统一实时平台,整合向量搜索、语义缓存、会话管理等功能,可降低基础设施复杂性和LLM成本,适合混合工作负载。专用数据库在超大规模或特殊调优时更优,pgvector适合小规模场景。选择取决于架构需求、运维能力和成本考量。
Rust项目五个团队采纳了关于LLM贡献的新政策,旨在规范AI使用,防止低质量PR和信任问题。政策要求公开LLM内容必须披露,禁止未经许可的生成代码,但允许用于翻译、分析等辅助用途。它强调人类理解优先,不强制使用LLM,并允许审查者关闭不合规PR。政策旨在透明化规则,平衡AI价值与社区协作,未来可能扩展至全项目。
LLM长上下文推理成本高,主因是KV缓存随token数线性增长,解码时需逐token读取全部缓存,受内存带宽限制。优化方法包括:分组查询注意力、潜在注意力减少每token存储;量化降低存储精度;驱逐机制减少token数;分页注意力和前缀缓存提升内存管理效率。各方法在质量、工程复杂度间权衡,适合长上下文和高并发场景。
本文探讨大语言模型推理延迟问题,涵盖预填充与解码两阶段及TTFT、TPOT指标。提出七种优化方法:模型量化、KV缓存、投机解码、连续批处理、剪枝蒸馏、优化推理引擎及提示压缩缓存。强调组合应用这些技术可显著降低延迟,但需权衡成本与复杂度,以提升生成式AI应用效率。
Meta的GEM广告推荐模型通过软硬件协同设计,将端到端训练效率提升至20-25% MFU,训练FLOPs一年内增长4倍。核心创新包括定制内核库(如Jagged Flash Attention、GDPA、BlockAttention)和混合超低精度训练提升计算效率;拓扑感知的5D并行、SM-free通信、自动激活检查点和负载均衡优化扩展效率。这些方法解决了推荐系统与LLM混合架构的独特挑战。
LLM安全的核心在于指令与数据无法分离,导致提示注入风险。攻击面包括输入、检索、模型、工具、输出及供应链。模型内部攻击影响有限,真正危险的是私密数据、不可信内容、外发通道并存的“致命三要素”。供应链可通过恶意模型文件入侵。防御需多层纵深,如CaMeL和最小权限原则,而非依赖单一过滤。
这是一款赛博朋克心理博弈RPG,玩家扮演求职者,在有限预算内与三位AI商人互动,购买装备、套取情报,影响回合制Boss战及多种结局。游戏探索LLM与场景深度互动,支持移动端和PC端,流程约5分钟,重玩价值来自AI生成的多样对话。
本周Python动态:推荐AI课程与资源,介绍tsauditor等时间序列数据检查工具,以及LangGraph构建智能体工作流。Netflix分享自建LLM服务经验,有作者用6GB显存训练生成式鼓点模型。另有Django爬虫工具、数据工具指南、浏览器运行LLVM等实用内容,涵盖开发、监控与AI应用。
RoPE通过旋转Q和K向量,使注意力分数依赖相对位置而非绝对位置。它利用多频率几何级数实现多尺度位置感知,保持向量范数,支持位置平移不变性。但存在周期性和相位混叠问题,长上下文需频率缩放或位置插值。RoPE不旋转V,无学习参数,是LLM中关键的位置编码方法。
该文章讨论Rust日报近期内容质量下降,指出自6月17日起,日报中充斥浮夸、无根据的评论性语言,如“项目最有意思的地方在于……”等,疑似由LLM生成,但风格突变,可能因更换模型或调整提示词所致。作者认为可通过优化提示词解决,但不确定是否为有意改动。
该论文提出可扩展多智能体系统的四大设计原则:简洁性、弹性反馈、顺序工作流及摘要通信,并构建参考架构。实验显示,缩放提升准确率但受限于底层LLM能力阈值,性能在中等复杂度达峰值后因超时退化,且一致性问题随规模扩大成为主要瓶颈。
完成下面两步后,将自动完成登录并继续当前操作。