该文章介绍了多个AI模型的API配置,包括Kimi、DeepSeek和小米MiMo。Kimi提供K3和K2.7代码模型,支持工具调用、视觉和长上下文;DeepSeek提供V4系列,支持长输入输出;小米MiMo提供V2.5系列,涵盖文本、视觉、语音识别和语音合成等功能。
作者利用LLM制作工具,为图标库补充颜色元数据。该工具通过HSV色相直方图分析未标记图标,生成HTML页面,左侧列出颜色,右侧分为“已标记”和“可能缺失”两栏。作者手动选择后复制ID,让LLM更新元数据。此方法高效,LLM擅长生成一次性代码,工具简单(HTML/CSS/JS),作者掌控视觉决策,避免盲目信任。
该研究证明,一条事实错误的针对性论证足以让大语言模型放弃正确答案。通过GRPO强化学习训练说服模型,Qwen-2.5-7B在TruthfulQA上的准确率从66.2%骤降至1.8%。该策略可跨模型迁移,对Qwen-14B和Llama-3.1-8B的PSR均超79%。闭源模型如GPT-5-mini更抗说服,但现有防御仍不充分,PBT-8B的PSR仍达60%。
LLM使编程语言选择不再重要,开发者可借助AI使用不熟悉的语言(如Rust、Zig)构建快速小型软件。这推动了更多人对性能的追求,并涉足DWARF、eBPF等复杂技术,尽管可能产生更多“垃圾代码”,但也扩大了开发者群体。
Rust官方通过4200份问卷和70余次访谈发现,学习Rust的真正难点并非语法,而是摆脱旧语言思维习惯。编译器报错信息是有效学习工具,LLM正降低学习门槛。企业培养Rust团队有成熟路径,但存在“静默流失”现象,社区氛围影响新人留存。
AI提升效率,但带来空洞与焦虑。Vibe coding快速实现想法,却削弱思考;LLM即时回应,缺乏深度。焦虑源于能力下滑、竞争加剧及被替代风险。解法在于适应技术,如蒸汽机时代,驾驭而非对抗,同时警惕效率提升不解决竞争,需持续努力。
Stripe确认以约80亿美元收购AI模型路由平台OpenRouter,为其最大收购。OpenRouter通过统一API连接数百个模型,优化成本与性能,日处理超10万亿token。Stripe旨在整合AI“token经济学”,帮助企业管理AI推理成本,提升盈利。OpenRouter保持品牌独立,交易反映AI成本管理成为企业核心需求。
论文提出BayesBeliefAgent,针对多智能体系统中伙伴中途换策略而智能体反应迟缓的问题,结合GPT-4o规划器与贝叶斯追踪,仅在动作与推断技能矛盾时触发重规划。在Overcooked基准上,该法将信念-行动差距从0.41降至0.20,重规划次数减少20-80倍,但Forced Coordination布局收益有限。
本文总结了IT领导者使用可观测性监控AI应用的七条经验:从MVP阶段就纳入LLM可观测性,避免“测量债务”;用非确定性指标监控概率系统;采用标准遥测词汇;让仪表报告已知数据;控制遥测成本;识别数据而非模型问题;以及成本可见性不等于质量保证。核心是尽早测量,以证明AI价值。
本教程介绍如何使用vLLM扩展AI代理的LLM推理。文章解释了LLM推理的预填充和解码阶段,以及AI代理工作负载为何难以服务。vLLM通过连续批处理、PagedAttention和前缀缓存优化并发推理。教程演示了在本地安装vLLM、启动服务器,并通过OpenAI兼容API连接AI代理的步骤,最后讨论了这些优化技术的重要性及适用场景。
本文介绍LLM API调用工程化实践:需权衡延迟、质量、成本与数据合规,选择合适访问模式;通过提示缓存和语义缓存降低成本,用指数退避处理限流,并以外置会话存储弥补API无状态缺陷。Redis Iris提供语义缓存、代理记忆等托管服务,构建AI上下文层,优化调用性能与成本。
LLM使计算机从精确指令转向理解模糊意图,但也带来更多意外后果。未来需区分专业与业余:专业人士应具备预见性,减少软件对日常生活的负面影响,避免“Oops,早该想到”的失误。
Expedia Group has open-sourced mockql-rs, a Rust CLI that fills @mock-annotated GraphQL fields with LLM-generated data at request time. It follows Airbnb's @generateMock in April and a GraphQL...
LLM预测可替代人类进行A/B测试,但需满足替代性和可比性假设。在Upworthy数据集中,校准LLM输出可恢复治疗效果,但线性校准失败,机器学习方法更有效。新治疗越偏离历史数据,假设越不可验证,LLM优势与风险并存。人类实验仍不可或缺,LLM可辅助筛选和降方差,但不能完全替代。
PromptCache是一个用Go编写的LLM语义缓存网关,通过向量相似度双阈值判定(高阈值直接命中、低阈值未命中、灰区用廉价模型仲裁)缓存重复请求,支持OpenAI兼容接口、多提供商热切换和持久化存储。它降低token成本和延迟,但存在语义误判、忽略上下文、多租户隔离不足及暴力扫描性能瓶颈等风险。
本文总结了Airbnb、Netflix、Lyft和Uber如何将因果推断应用于LLM功能测量。核心要点:根据部署机制选择方法(如DiD、RDD、AIPW),运行诊断验证假设,将短期指标与长期价值关联,并让因果估计支持前瞻性决策。强调提前埋点、匹配方法与场景、避免混淆数据,以可靠评估AI功能真实影响。
本文介绍双重稳健估计(AIPW)在AI产品因果推断中的应用。针对用户自选加入导致的偏差,AIPW结合倾向得分和结果模型,只要其中一个正确即可获得一致估计。通过Python实现和模拟数据验证,AIPW能纠正选择偏差,恢复真实效应(+8%),并展示模型误设时的稳健性,同时讨论其局限和实际应用策略。
本文介绍AI评估工程,强调仅靠演示和直觉开发AI系统不可靠。核心是采用评估驱动开发,通过三层架构(离线数据集评估、CI/CD门禁、生产监控)系统化评估RAG和智能体系统。重点包括构建黄金数据集、使用六项RAG指标、校准LLM评判器,并持续从生产故障中学习,以保障系统质量。
文章探讨了LLM对个人能力的影响,指出过去人们通过搜索和思考构建理解与行动力,而如今依赖LLM虽便捷高效,却削弱了自身成长,如同不再自己修车,导致依赖加深,丧失独立维护和创新能力。核心观点是过度使用LLM会阻碍个人能力发展。
本文介绍五门免费课程,帮助不同水平的人学习现代AI和LLM,涵盖工作应用、AI编程、LLM深度技术、RAG应用开发及Hugging Face工具。强调学习AI无需昂贵费用,可利用免费资源、GPU和API,通过实践构建项目来掌握技能,而非仅看视频。
完成下面两步后,将自动完成登录并继续当前操作。