新推出的rerank-2.5系列显著提升了检索准确性,支持32K令牌上下文长度和指令跟随功能,准确性较Cohere Rerank v3.5提高7.94%。用户可通过自然语言指令优化模型输出。
我们推出了rerank-2.5系列,显著提升检索准确性,并首次引入指令跟随功能。该系列在93个数据集上比Cohere Rerank v3.5提高约8%。新功能支持用户通过自然语言调整模型输出的相关性评分,适用于32K令牌上下文长度,便于处理更长文档的检索。
随着大型语言模型的发展,本文提出了一种动态剪枝方法——指令跟随剪枝,能够根据用户指令动态选择模型参数。该方法通过优化稀疏掩码预测器和LLM,显著提升了推理效率和性能,实验结果在多个评估基准上表现优异。
本研究提出了一种创新方法,利用大型语言模型提升国际口语翻译研讨会(IWSLT)中的语音翻译与指令跟随任务的性能。通过融合多个自动语音识别系统的输出,采用两步翻译和文档级精炼,显著提高了翻译质量。
本研究提出了ManipDreamer,通过引入动作树和视觉引导,显著提升了机器人操控视频合成中的指令跟随和视觉质量。
中科院团队通过「预训练 + 监督微调」提升了图文大模型的指令跟随能力,结合高质量指令与类R1强化学习,显著增强了视觉定位能力。Qwen2.5-VL模型在复杂任务中的性能提升达50%。该方法已开源,有效解决了目标定位中的多项挑战,展现出良好的泛化性与通用能力。
本研究提出WildIFEval数据集,包含12000条多样化用户指令,揭示了现有语言模型在处理多约束指令时的不足,为复杂条件下的指令跟随研究提供了基础数据支持。
本研究提出了一种新框架“偏好目标调优”(PGT),旨在优化开放世界代理的指令跟随政策。PGT通过收集环境轨迹并基于偏好进行分类,调整初始目标的潜在表示。实验结果表明,PGT显著提升了代理性能,并展现出良好的泛化能力。
本研究提出了长文境指令跟随基准(LIFBench)和评估框架(LIFEval),旨在提升大型语言模型在长文境输入中跟随指令的能力。这些工具有效评估模型在复杂长文境下的表现,并为未来模型开发提供重要见解。
本文提出了一种新方法,通过自动标记文本与指令,构建高质量的指令跟随语言模型。该方法利用少量种子数据和网络语料库进行微调,生成训练样本并选择高质量例子。研究表明,模型在多语言翻译和复杂任务中表现优异,特别是在未见语言的翻译上有显著提升。
OneLLM通过多模态编码器和对齐管道,将八种模态与语言结合,提升了指令跟随能力。研究表明其在多模态任务中的表现优异,包括图像压缩和生成。新方法利用文本信息引导图像压缩,显著提高了性能。ModaVerse模型简化了多模态训练,降低了成本,提高了效率。
中国版OpenAI发布智谱清影,一款免费无限次数生成视频的AI产品,取得巨大进步。支持文本和图片生成视频,具有强大的指令跟随能力。视频生成效果有提升空间,AI视频生成正在成为创作者的工具。
本文介绍了一种新方法BayLing,通过互动翻译任务提升非英语语言模型的性能。研究表明,BayLing在多轮指令跟随和词语翻译等任务中表现优异,尤其在汉语任务中效果显著,超越了英语模型。
VisIT-Bench是一个用于评估面向实际应用的指令跟随视觉语言模型的基准测试。该基准测试收集了70个指令家族,数据集包含592个测试查询。VisIT-Bench对参与者是动态的,实践者只需在项目网站上提交其模型的响应。
Dolly 2.0是一个开源的大型语言模型,经过人类生成的指令数据集fine-tuned。数据集包含15,000个高质量的人类生成的提示/响应对,专门设计用于指令调整大型语言模型。该模型基于EleutherAI pythia模型系列,适用于商业使用。模型权重、训练代码和数据集都是开源的。Dolly 2.0表现出高质量的指令跟随行为,可用于摘要和内容生成。发布Dolly 2.0和开源数据集鼓励在人工智能领域进行评论、研究和创新。
完成下面两步后,将自动完成登录并继续当前操作。