本文介绍管理大语言模型小上下文窗口的三种实用策略:滑动窗口截断法,通过FIFO队列保留最近对话,控制token使用;令牌预算结合检索增强生成,按比例分配上下文空间,确保只纳入最相关信息;以及滚动摘要、提示压缩和观察掩蔽等进阶方法。文章强调小上下文窗口能降低成本、减少延迟,并避免“迷失在中间”问题。
Liquid AI发布LFM2.5-VL-3B,31亿参数视觉语言模型,专为设备端设计,支持屏幕理解、函数调用、锚定和多图像输入。在28项基准测试中平均得分69.4,与4.7B模型相当。内存占用约3GB,解码速度228 tok/s。许可证对年收入低于1000万美元的公司免费,高收入需商业许可。
本文比较了自回归语言模型(ARMs)与扩散语言模型(DLMs)的性能。DLMs通过并行生成令牌提高算术强度,但长上下文扩展不佳;块状解码可改善此问题。批处理推理中,ARMs因序列并行优势吞吐量更高。减少采样步数是DLMs降低延迟的关键。
本文介绍语言模型解码策略与输出控制。解码算法将模型logits转为文本,影响生成质量。主要方法包括:贪心解码(确定性但可能单调)、温度采样(控制随机性)、Top-k与核采样(过滤低概率词)、重复惩罚(减少重复)、束搜索(多候选但成本高)、停止条件及结构化输出约束(如JSON)。选择合适策略需平衡质量与性能。
本文概述斯坦福CS336作业一:构建Transformer语言模型。核心流程为文本→分词→Transformer→损失→梯度更新。内容涵盖BPE分词、自注意力、RoPE位置编码、RMSNorm、SwiGLU、交叉熵损失、AdamW优化器、学习率调度、梯度裁剪及推理时的温度与top-p采样,并讨论了训练与推理的差异及实验设计要点。
论文提出ORCA-bench,一个生产保真度的根因分析基准测试,用真实微服务系统评估语言模型Agent。在1,079个任务中,最佳模型中等难度准确率仅25.3%,困难任务仅10.0%,且移除源代码访问会降低性能。测试床含六天遥测数据,结果经专家验证,但真实系统更复杂,实际表现可能更差。
神经科学家墨菲通过深部电极研究癫痫患者大脑,发现语言组词(句法)是独立于语义的先天程序,由后颞上沟等核心区快速生成结构,再交由其他脑区解读。他批评大型语言模型仅查表无真智力,并探讨了语言与概念系统的连接、物理与非物质界限等哲学问题。
高迪通过绳子和沙袋模拟教堂结构,利用重力找到受力平衡;语言模型则通过反向传播和梯度下降调整参数,降低预测误差。两者都依赖局部相互作用达成全局最优,无需中央指挥。高迪让力画出形状,工程师让数据塑造模型,本质都是先设约束,再让系统自行演化出答案。
GraphEval是亚马逊研究者提出的框架,利用知识图谱检测大语言模型的幻觉问题。它通过构建语义三元组,并用自然语言推理模型评估每个三元组是否被上下文蕴含,未蕴含的即标记为幻觉。该框架强调可解释性,便于定位幻觉根源。
本文探讨了语言模型“束具”(harness)在组合泛化中的关键作用。通过递归语言模型(RLM)设计,将复杂任务分解为局部分布内的子调用,训练短任务可泛化至8-32倍长任务,并跨领域迁移。相比直接训练Transformer,RLM显著提升泛化能力,表明束具可编码高层归纳偏置,降低数据成本,是提升扩展回报的核心。
本文介绍了如何在15分钟内使用Ollama在本地运行小型语言模型。用户只需安装Ollama、下载模型(如Llama 3.2 3B)并开始聊天。Ollama通过量化技术减少内存占用,确保模型高效运行,保障数据安全和隐私。
Semih Yavuz等人的研究提出了一种新方法,将过程性信号转化为可复用的程序性记忆,从而提升语言模型的性能。该方法通过三级抽象和协同进化,确保模型在推理时无需外部记忆模块,减少延迟并提高效率。实验结果表明,PMD在LIVECODEBENCH基准上相较于传统方法有显著提升,并在不同难度问题上表现一致。
本文介绍了开源库“outlines”,旨在提高大型语言模型(LLM)生成结构化输出的准确性。通过示例,展示了如何进行情感分析、生成符合Pydantic模型的JSON对象,以及为REST API生成有效的JSON负载。outlines通过限制生成过程中的非法符号,确保输出符合预期格式,减少常见错误和不确定性。
自一致性是一种新型解码策略,通过生成多个独立推理路径并选择最一致的答案,显著提升大型语言模型的推理能力。该方法克服了传统链式思维的局限,允许模型在选择答案前探索多种可能性,从而提高准确性。实验表明,自一致性在算术、常识和符号推理任务中表现优异,证明更好的推理不一定依赖于更大的模型或额外的训练。
Anthropic的研究揭示了Claude语言模型中的“J空间”,这是一个激活少量概念以进行推理的小型工作区。研究发现Claude能够在心中记住概念而不影响输出,并能识别“虚假”标签,显示其对监控的意识。删除J空间后,Claude在复杂推理中的表现显著下降。这一发现对AI的可解释性和安全性具有重要意义,可能影响未来的AI对齐和隐私讨论。
阿里巴巴与清华大学合作的论文《灵活性陷阱》入选ICML杰出论文,质疑扩散语言模型任意顺序生成的价值。研究表明,任意顺序生成会导致推理能力下降,提出的“JustGRPO”方法强制模型从左到右生成,显著提高推理效果。
本文探讨了连续扩散口语语言模型(CD SLM)的可行性,指出其在性能上优于离散自回归模型。通过音素詹森-香农散度(pJSD)指标的引入,分析显示CD SLM在验证损失和pJSD上遵循缩放规律。尽管其生成多语种情感语音的能力增强,实现长篇连贯性仍面临挑战。
强化学习微调的视觉语言模型在视觉推理基准上有所提升,但仍受到视觉基础薄弱、幻觉和文本线索过度依赖的影响。简单的文本扰动显著降低了模型的鲁棒性和信心。开放源代码模型在连贯性方面表现不佳,而封闭模型则更为稳健。微调提高了基准准确性,但可能削弱推理的可靠性。建议采用关注忠实度的奖励机制,以改善推理的准确性和鲁棒性。
残余上下文扩散语言模型(RCD)通过回收被丢弃的令牌,提升了扩散大语言模型(dLLMs)的效率。RCD将这些令牌转化为上下文残差,注入下一步去噪中。该方法在多个基准测试中提高了5-10个百分点的准确率,特别是在AIME任务中,准确率几乎翻倍,去噪步骤减少4-5倍。
本文探讨了扩散语言模型(dLLMs)的采样策略,提出通过强化学习训练采样过程,以提高解码效率和样本质量。研究表明,基于单层变换器的轻量级策略在全扩散设置中优于传统启发式方法,尤其在代码生成任务中表现出色。
完成下面两步后,将自动完成登录并继续当前操作。