小红花·文摘
  • 首页
  • 广场
  • 排行榜🏆
  • 直播
  • FAQ
Dify.AI
在Kubernetes中使用vLLM运行自托管的大型语言模型(LLM)

本文介绍了在Kubernetes环境中自托管大型语言模型(LLM)的设置,使用vLLM作为推理引擎,LINSTOR提供持久存储。自托管可降低成本、提高控制力,并满足数据合规要求。通过创建持久卷声明和密钥,部署vLLM推理服务器,确保模型权重缓存以加快重启速度,支持高并发请求,适合混合AI应用。

在Kubernetes中使用vLLM运行自托管的大型语言模型(LLM)

Cloud Native Computing Foundation
Cloud Native Computing Foundation · 2026-07-16T11:00:00Z
尴尬的简单自我蒸馏提升代码生成

本文探讨了一种简单的自我蒸馏方法(SSD),通过利用大型语言模型(LLM)自身的输出来改进代码生成。SSD在LiveCodeBench v6上将Qwen3-30B-Instruct的通过率从42.4%提升至55.3%。该方法通过调整温度和截断配置,优化了模型的输出,尤其在解决复杂问题时表现更佳。SSD为LLM代码生成提供了一种有效的后训练改进方向。

尴尬的简单自我蒸馏提升代码生成

Apple Machine Learning Research
Apple Machine Learning Research · 2026-07-16T00:00:00Z
大型语言模型函数调用的不确定性量化

大型语言模型(LLM)在自主解决现实任务中越来越重要,尤其是在函数调用方面。错误的函数调用可能导致严重后果,因此评估LLM对函数调用正确性的信心至关重要。本文首次探讨了不确定性量化(UQ)方法在LLM函数调用中的应用,结果显示多样本UQ方法在此场景中并未显著优于单样本方法。通过聚类输出和选择语义相关的标记,可以提升现有UQ方法的性能。

大型语言模型函数调用的不确定性量化

Apple Machine Learning Research
Apple Machine Learning Research · 2026-07-15T00:00:00Z
大型语言模型如何学习提供帮助(RLHF与DPO)

本文探讨了大型语言模型(LLMs)如何通过人类反馈学习,比较了强化学习(RLHF)和直接偏好优化(DPO)两种方法。模型首先通过预训练学习语言和知识,然后通过监督微调学习遵循指令,最后通过比较学习偏好。RLHF通过训练奖励模型并优化,而DPO则简化为单一步骤。两者都依赖于人类判断的信号,但可能导致模型产生迎合性回答。对于可验证的任务,使用可验证奖励可以避免这些问题。

大型语言模型如何学习提供帮助(RLHF与DPO)

ByteByteGo Newsletter
ByteByteGo Newsletter · 2026-07-14T15:30:53Z
领域特定语言(DSL)促进大型语言模型(LLM)的可靠使用

本文探讨了领域特定语言(DSL)与大型语言模型(LLM)的结合。LLM在DSL的约束环境中表现出色,能够根据自然语言生成代码。DSL提供明确的语法和语义模型,帮助开发者设计和实现复杂系统。文章介绍了Tickloom框架,展示了如何利用DSL简化分布式系统的开发与测试。LLM在设计阶段作为头脑风暴伙伴,在DSL建立后则作为自然语言接口,提升开发效率。

领域特定语言(DSL)促进大型语言模型(LLM)的可靠使用

Martin Fowler
Martin Fowler · 2026-07-14T12:51:00Z

大型语言模型(LLM)在生产环境中的应用可能导致延迟和成本增加。优化策略包括测量延迟、减少输出令牌、使用小模型处理简单任务、减少模型调用次数、设计可缓存的提示、添加多层缓存、控制上下文预算、批处理非交互式工作、优化批处理、管理缓存和上下文长度、基准测试优化效果、实施流量控制和优雅降级。这些方法能有效降低延迟和成本,提高系统效率。

在生产环境中减少大型语言模型延迟和推理成本的12种方法

KDnuggets
KDnuggets · 2026-07-14T12:00:33Z
论文图表可视化工具

陶哲轩在文章中探讨了数学论文可视化工具的研究进展,特别是利用大型语言模型生成数学图表的能力。他开发了一款应用程序,可以以交互式图形展示定理之间的依赖关系,帮助用户理解复杂的数学论文。尽管生成的图表可能不完全准确,但希望能作为理解论文的初步指南。

论文图表可视化工具

What's new by TerryTao
What's new by TerryTao · 2026-07-14T05:34:36Z
大模型也得睡觉做梦?新研究用睡眠机制解决AI遗忘难题

最新研究表明,大型语言模型(LLM)在处理新数据时会出现“灾难性遗忘”。通过引入“主动期”和“睡眠期”,模型能够在主动期快速吸收新知识,并在睡眠期整理和巩固记忆。这一机制模仿人类睡眠中的记忆整理过程,显著提升了模型对新旧知识的保留能力,减少了遗忘现象。

大模型也得睡觉做梦?新研究用睡眠机制解决AI遗忘难题

极道
极道 · 2026-07-14T00:41:00Z

本文介绍了开源库“outlines”,旨在提高大型语言模型(LLM)生成结构化输出的准确性。通过示例,展示了如何进行情感分析、生成符合Pydantic模型的JSON对象,以及为REST API生成有效的JSON负载。outlines通过限制生成过程中的非法符号,确保输出符合预期格式,减少常见错误和不确定性。

使用轮廓进行结构化语言模型生成

KDnuggets
KDnuggets · 2026-07-13T14:00:03Z

作者对人工智能(AI)和大型语言模型(LLM)充满热情,认为技术进步令人振奋。他批评了关于AI将主宰未来的夸大宣传,认为这种负面情绪令人沮丧。AI的价值主要源于计算能力的提升,而非实验室的努力。编程方式正在变化,AI工具可以提高生产力,但需谨慎使用,以免增加认知疲劳。

我热爱大型语言模型,但厌恶夸大宣传

the singularity is nearer
the singularity is nearer · 2026-07-12T07:00:00Z
大型语言模型(LLM)框架比较:LangChain、LlamaIndex与原始API调用

本文比较了三种大型语言模型(LLM)框架:LangChain、LlamaIndex和原始API调用。LangChain适合复杂应用的多步骤操作,LlamaIndex专注于高效的数据检索,而原始API调用则提供最低延迟和最高透明度。选择合适的框架应根据项目需求,简单任务使用原始API,文档检索使用LlamaIndex,状态管理和多步骤推理适合LangChain。建议根据实际需求逐步引入框架。

大型语言模型(LLM)框架比较:LangChain、LlamaIndex与原始API调用

MachineLearningMastery.com
MachineLearningMastery.com · 2026-07-09T15:38:56Z

文章讨论了通过错误恢复和任务系统增强大型语言模型(LLM)的能力。针对常见故障(如输出截断、输入过长等),提出了自我恢复的方法。任务系统将大目标拆分为小任务,支持持久化和依赖管理,提升规划能力。后台任务功能允许LLM在执行耗时操作时继续处理其他任务,保持高效性。

AI in Harness(二)——错误恢复、任务规划与后台执行:Error Recovery、Task System 与 Background Task

犀利豆的博客
犀利豆的博客 · 2026-07-08T21:12:17Z
AI论文评审:自一致性提升语言模型中的链式思维推理

自一致性是一种新型解码策略,通过生成多个独立推理路径并选择最一致的答案,显著提升大型语言模型的推理能力。该方法克服了传统链式思维的局限,允许模型在选择答案前探索多种可能性,从而提高准确性。实验表明,自一致性在算术、常识和符号推理任务中表现优异,证明更好的推理不一定依赖于更大的模型或额外的训练。

AI论文评审:自一致性提升语言模型中的链式思维推理

freeCodeCamp.org
freeCodeCamp.org · 2026-07-08T18:55:53Z
代理循环:人工智能如何从回答问题转向执行任务

本文探讨了人工智能代理的工作原理,特别是大型语言模型(LLM)如何通过循环结构实现自主决策。代理通过感知、推理、行动和观察四个步骤不断迭代,直至得出最终答案。与传统工作流相比,代理提供了更大的灵活性,但也增加了错误累积的风险和复杂性,因此开发者需谨慎选择是否使用代理。

代理循环:人工智能如何从回答问题转向执行任务

ByteByteGo Newsletter
ByteByteGo Newsletter · 2026-07-08T15:30:07Z
NVIDIA 发布 Audex (Nemotron-Labs-Audex-30B-A3B):一种统一的音频-文本大语言模型

NVIDIA 发布了 Audex,这是一个统一的音频-文本大型语言模型,具备理解和生成音频及语音的能力,同时保持文本智能。Audex 采用 30 亿参数的 MoE 结构,设计简洁,避免了多模态模型的性能退化,在文本和音频任务中表现优异,尤其在语音识别领域领先。尽管存在商业许可限制和音频理解能力不足等缺点,Audex 仍在多项任务中表现出色。

NVIDIA 发布 Audex (Nemotron-Labs-Audex-30B-A3B):一种统一的音频-文本大语言模型

实时互动网
实时互动网 · 2026-07-08T02:20:40Z
初学者的AI代理

我们在freeCodeCamp.org的YouTube频道发布了一门关于AI代理的深入视频课程。课程由CodeCloud创始人Mumshad Mannambeth主讲,内容包括大型语言模型基础、工作流程与自主代理的区别、四种代理个性的构建,以及生产模式与安全性设计。最后,通过分析OpenClaw案例,学习动态系统提示的构建。

初学者的AI代理

freeCodeCamp.org
freeCodeCamp.org · 2026-07-07T15:35:18Z

文章讨论了一个新的阻碍因素,尽管影响不大,但仍需解决。同时提到在大型语言模型(LLM)政策讨论中有更多活动,计划下周发布相关想法。

本周在PSC (231) | 2026年6月29日

blogs.perl.org
blogs.perl.org · 2026-07-07T06:05:30Z
DynaMiCS:使用动态混合进行具有性能约束的大型语言模型微调

DynaMiCS是一种动态混合优化器,旨在多领域微调大型语言模型,提升目标领域性能的同时保持约束领域的性能。该方法通过短期领域特定探测估计交叉领域效应,并优化混合权重,以降低计算成本,实现更好的目标领域改进和约束满足。

DynaMiCS:使用动态混合进行具有性能约束的大型语言模型微调

Apple Machine Learning Research
Apple Machine Learning Research · 2026-07-07T00:00:00Z
单个神经元足以绕过大型语言模型中的安全对齐

研究发现,单个神经元能够绕过大型语言模型的安全对齐。通过针对拒绝神经元和概念神经元的研究,发现可以在不进行训练的情况下抑制有害请求或从无害提示中引发有害内容。这表明安全对齐并非均匀分布,而是由个别神经元决定。

单个神经元足以绕过大型语言模型中的安全对齐

Apple Machine Learning Research
Apple Machine Learning Research · 2026-07-07T00:00:00Z
为什么传统的CI/CD无法满足大型语言模型的需求(以及我们为解决这个问题而建立的发布门控)

传统的CI/CD门控无法满足生产AI系统的需求。文章提出了一种实用的发布门控方法,基于基线评估、漂移检测、影子验证和成本/延迟控制,以防止AI回归。通过实时监测模型表现,确保发布的AI系统在可接受范围内,避免用户体验下降。

为什么传统的CI/CD无法满足大型语言模型的需求(以及我们为解决这个问题而建立的发布门控)

The New Stack
The New Stack · 2026-07-02T13:00:00Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码