小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
Dify.AI

Expedia Group has open-sourced mockql-rs, a Rust CLI that fills @mock-annotated GraphQL fields with LLM-generated data at request time. It follows Airbnb's @generateMock in April and a GraphQL...

LLM-Generated GraphQL Mocks Arrive at Airbnb and Expedia, While the Spec Lags Behind

InfoQ InfoQ · 2026-08-14T10:01:00Z
LLM何时能替代人类进行A/B测试?

LLM预测可替代人类进行A/B测试,但需满足替代性和可比性假设。在Upworthy数据集中,校准LLM输出可恢复治疗效果,但线性校准失败,机器学习方法更有效。新治疗越偏离历史数据,假设越不可验证,LLM优势与风险并存。人类实验仍不可或缺,LLM可辅助筛选和降方差,但不能完全替代。

LLM何时能替代人类进行A/B测试?

Spotify Engineering Spotify Engineering · 2026-08-13T18:57:22Z

PromptCache是一个用Go编写的LLM语义缓存网关,通过向量相似度双阈值判定(高阈值直接命中、低阈值未命中、灰区用廉价模型仲裁)缓存重复请求,支持OpenAI兼容接口、多提供商热切换和持久化存储。它降低token成本和延迟,但存在语义误判、忽略上下文、多租户隔离不足及暴力扫描性能瓶颈等风险。

PromptCache:LLM 语义缓存网关的架构与实现

阁子 阁子 · 2026-08-12T02:40:05Z
大规模产品实验:Airbnb、Netflix、Lyft和Uber如何对基于LLM的AI功能进行因果推断

本文总结了Airbnb、Netflix、Lyft和Uber如何将因果推断应用于LLM功能测量。核心要点:根据部署机制选择方法(如DiD、RDD、AIPW),运行诊断验证假设,将短期指标与长期价值关联,并让因果估计支持前瞻性决策。强调提前埋点、匹配方法与场景、避免混淆数据,以可靠评估AI功能真实影响。

大规模产品实验:Airbnb、Netflix、Lyft和Uber如何对基于LLM的AI功能进行因果推断

freeCodeCamp.org freeCodeCamp.org · 2026-08-11T16:47:38Z
双重稳健估计下的产品实验:当LLM应用中的两个模型都出错时

本文介绍双重稳健估计(AIPW)在AI产品因果推断中的应用。针对用户自选加入导致的偏差,AIPW结合倾向得分和结果模型,只要其中一个正确即可获得一致估计。通过Python实现和模拟数据验证,AIPW能纠正选择偏差,恢复真实效应(+8%),并展示模型误设时的稳健性,同时讨论其局限和实际应用策略。

双重稳健估计下的产品实验:当LLM应用中的两个模型都出错时

freeCodeCamp.org freeCodeCamp.org · 2026-08-11T00:00:45Z
AI评估工程:从零构建生产级LLM评估平台 [完整手册]

本文介绍AI评估工程,强调仅靠演示和直觉开发AI系统不可靠。核心是采用评估驱动开发,通过三层架构(离线数据集评估、CI/CD门禁、生产监控)系统化评估RAG和智能体系统。重点包括构建黄金数据集、使用六项RAG指标、校准LLM评判器,并持续从生产故障中学习,以保障系统质量。

AI评估工程:从零构建生产级LLM评估平台 [完整手册]

freeCodeCamp.org freeCodeCamp.org · 2026-08-10T20:42:28Z

文章探讨了LLM对个人能力的影响,指出过去人们通过搜索和思考构建理解与行动力,而如今依赖LLM虽便捷高效,却削弱了自身成长,如同不再自己修车,导致依赖加深,丧失独立维护和创新能力。核心观点是过度使用LLM会阻碍个人能力发展。

行动许可证

Jim Nielsen’s Blog Jim Nielsen’s Blog · 2026-08-09T19:00:00Z

本文介绍五门免费课程,帮助不同水平的人学习现代AI和LLM,涵盖工作应用、AI编程、LLM深度技术、RAG应用开发及Hugging Face工具。强调学习AI无需昂贵费用,可利用免费资源、GPU和API,通过实践构建项目来掌握技能,而非仅看视频。

学习现代AI和LLM的5门免费课程

KDnuggets KDnuggets · 2026-08-07T12:00:30Z
首个面向LLM的蛋白突变排序标准化评测基准!哈佛大学团队提出PG-LLM,一次性测评13款主流模型+95种专业模型

哈佛大学等团队提出PG-LLM基准测试,首次统一评估13款通用语言模型与95种专业蛋白质预测工具。结果显示,Claude Opus 5等通用模型在蛋白突变排序上超越半数专业工具,但落后于顶尖模型VenusREM。研究揭示通用模型随推理资源增加性能提升有限,且对候选集规模敏感,为蛋白质工程工具选择与融合提供新思路。

首个面向LLM的蛋白突变排序标准化评测基准!哈佛大学团队提出PG-LLM,一次性测评13款主流模型+95种专业模型

HyperAI超神经 HyperAI超神经 · 2026-08-05T12:43:03Z
RAG流水线的顶级向量数据库替代方案

本文比较了Redis与专用向量数据库(如Pinecone、Milvus、Qdrant)及pgvector的优劣。Redis作为统一实时平台,整合向量搜索、语义缓存、会话管理等功能,可降低基础设施复杂性和LLM成本,适合混合工作负载。专用数据库在超大规模或特殊调优时更优,pgvector适合小规模场景。选择取决于架构需求、运维能力和成本考量。

RAG流水线的顶级向量数据库替代方案

Redis Blog Redis Blog · 2026-08-05T00:00:00Z
rust-lang/rust 正在采纳一项 LLM 政策

Rust项目五个团队采纳了关于LLM贡献的新政策,旨在规范AI使用,防止低质量PR和信任问题。政策要求公开LLM内容必须披露,禁止未经许可的生成代码,但允许用于翻译、分析等辅助用途。它强调人类理解优先,不强制使用LLM,并允许审查者关闭不合规PR。政策旨在透明化规则,平衡AI价值与社区协作,未来可能扩展至全项目。

rust-lang/rust 正在采纳一项 LLM 政策

Inside Rust Blog Inside Rust Blog · 2026-08-05T00:00:00Z
为什么大语言模型的内存成本高昂以及如何解决

LLM长上下文推理成本高,主因是KV缓存随token数线性增长,解码时需逐token读取全部缓存,受内存带宽限制。优化方法包括:分组查询注意力、潜在注意力减少每token存储;量化降低存储精度;驱逐机制减少token数;分页注意力和前缀缓存提升内存管理效率。各方法在质量、工程复杂度间权衡,适合长上下文和高并发场景。

为什么大语言模型的内存成本高昂以及如何解决

ByteByteGo Newsletter ByteByteGo Newsletter · 2026-08-04T15:31:00Z

本文探讨大语言模型推理延迟问题,涵盖预填充与解码两阶段及TTFT、TPOT指标。提出七种优化方法:模型量化、KV缓存、投机解码、连续批处理、剪枝蒸馏、优化推理引擎及提示压缩缓存。强调组合应用这些技术可显著降低延迟,但需权衡成本与复杂度,以提升生成式AI应用效率。

降低LLM工作流推理延迟的七种方法

KDnuggets KDnuggets · 2026-08-04T12:00:59Z
GEM训练:Meta如何将其LLM规模广告基础模型的效率提升一倍

Meta的GEM广告推荐模型通过软硬件协同设计,将端到端训练效率提升至20-25% MFU,训练FLOPs一年内增长4倍。核心创新包括定制内核库(如Jagged Flash Attention、GDPA、BlockAttention)和混合超低精度训练提升计算效率;拓扑感知的5D并行、SM-free通信、自动激活检查点和负载均衡优化扩展效率。这些方法解决了推荐系统与LLM混合架构的独特挑战。

GEM训练:Meta如何将其LLM规模广告基础模型的效率提升一倍

Engineering at Meta Engineering at Meta · 2026-08-03T18:00:17Z
LLM安全基础:完整威胁模型

LLM安全的核心在于指令与数据无法分离,导致提示注入风险。攻击面包括输入、检索、模型、工具、输出及供应链。模型内部攻击影响有限,真正危险的是私密数据、不可信内容、外发通道并存的“致命三要素”。供应链可通过恶意模型文件入侵。防御需多层纵深,如CaMeL和最小权限原则,而非依赖单一过滤。

LLM安全基础:完整威胁模型

ByteByteGo Newsletter ByteByteGo Newsletter · 2026-08-03T15:31:14Z
Project C.A.G.E——AI驱动的赛博肉鸽

这是一款赛博朋克心理博弈RPG,玩家扮演求职者,在有限预算内与三位AI商人互动,购买装备、套取情报,影响回合制Boss战及多种结局。游戏探索LLM与场景深度互动,支持移动端和PC端,流程约5分钟,重玩价值来自AI生成的多样对话。

Project C.A.G.E——AI驱动的赛博肉鸽

雪猫社 雪猫社 · 2026-08-02T16:16:07Z
Python Hub 每周摘要(2026-08-02)

本周Python动态:推荐AI课程与资源,介绍tsauditor等时间序列数据检查工具,以及LangGraph构建智能体工作流。Netflix分享自建LLM服务经验,有作者用6GB显存训练生成式鼓点模型。另有Django爬虫工具、数据工具指南、浏览器运行LLVM等实用内容,涵盖开发、监控与AI应用。

Python Hub 每周摘要(2026-08-02)

Python Hub Weekly Python Hub Weekly · 2026-08-02T12:00:00Z

RoPE通过旋转Q和K向量,使注意力分数依赖相对位置而非绝对位置。它利用多频率几何级数实现多尺度位置感知,保持向量范数,支持位置平移不变性。但存在周期性和相位混叠问题,长上下文需频率缩放或位置插值。RoPE不旋转V,无学习参数,是LLM中关键的位置编码方法。

RoPE:性质、模式与长上下文行为

Louis Aeilot's Blog Louis Aeilot's Blog · 2026-08-02T02:00:00Z

该文章讨论Rust日报近期内容质量下降,指出自6月17日起,日报中充斥浮夸、无根据的评论性语言,如“项目最有意思的地方在于……”等,疑似由LLM生成,但风格突变,可能因更换模型或调整提示词所致。作者认为可通过优化提示词解决,但不确定是否为有意改动。

Rust日报LLM相关问题

Rust.cc Rust.cc · 2026-08-01T10:17:21Z
一分钟读论文:《可扩展 LLM 驱动多智能体系统的设计原则》

该论文提出可扩展多智能体系统的四大设计原则:简洁性、弹性反馈、顺序工作流及摘要通信,并构建参考架构。实验显示,缩放提升准确率但受限于底层LLM能力阈值,性能在中等复杂度达峰值后因超时退化,且一致性问题随规模扩大成为主要瓶颈。

一分钟读论文:《可扩展 LLM 驱动多智能体系统的设计原则》

Micropaper Micropaper · 2026-08-01T00:00:00Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码