Mistral AI 发布了 Mistral Small 4,具备指令执行、推理和多模态理解功能,支持256k上下文窗口,具有可配置推理强度,提升了推理效率和经济性,适合通用聊天和复杂推理。
Anthropic推出Claude Sonnet 4.5,称其为“世界最佳编码模型”。新版本在指令执行和代码重构方面更可靠,得分显著提高。同时,Claude Code也更新,增加了VS Code扩展和实时修改功能。新实验“Imagine with Claude”展示了实时生成软件的能力,目前仅限Claude Max用户使用。
OpenAI推出了GPT-4.1和GPT-4.1 mini模型,现已在ChatGPT中可用。所有付费用户均可访问,免费用户暂时无法使用。新模型在编码任务和指令执行方面表现更佳,支持更大的上下文窗口,速度也有所提升。GPT-4.1 mini成为所有用户的默认选项。
OpenAI推出了GPT-4.1系列模型,包括标准版、迷你版和纳米版,支持高达100万个上下文标记,提升了长文本理解能力。与Claude 3.7 Sonnet和Gemini 2.5 Pro相比,GPT-4.1在编码和指令执行方面表现优异,但在某些任务上仍需改进。
本研究提出了MultiChallenge基准,旨在评估大型语言模型在多轮对话中的能力。该基准识别了四类挑战,要求模型在执行指令和上下文推理方面表现出色。目前,尽管现有模型在其他评估中得分较高,但在MultiChallenge上的准确率均低于50%。
AMD Zen 5 微架构评测显示其性能显著提升,采用宏操作与微操作分解,优化指令执行。Op Cache 的动态测试表明其对性能影响显著,解码宽度限制和指令融合技术提升了 IPC,L1 和 L2 缓存容量测试验证了设计有效性。整体而言,Zen 5 在多线程和浮点性能上表现优异。
本文探讨了基于强化学习的大型语言模型(LLM)在提高指令执行效率和降低成本方面的应用。研究提出了新的框架和方法,利用LLM的预训练知识训练小规模代理,以提升样本效率和性能。实验结果表明,该方法在多种任务中表现优异,推动了自主代理在各领域的应用潜力。
GRIF模型通过语言与目标图像的对齐,提升了机器人执行指令的能力。它结合语言条件和目标条件的学习,利用大量未标注的轨迹数据,提高了任务执行效率。实验表明,GRIF在多场景下表现优异,能够有效理解和执行复杂指令,克服了传统方法的局限性。未来可探索更丰富的语义对齐方法。
完成下面两步后,将自动完成登录并继续当前操作。