Thinking Machines Lab发布了Tinker,简化了大模型微调过程,使研究人员能够更灵活地控制算法和数据。Tinker支持Qwen3和Llama3模型,降低成本并提高实验效率,受到业界关注,旨在吸引更多人参与前沿研究。
机器之心数据服务现已上线,提供高效稳定的数据获取,简化数据爬取流程。
Common Pile团队开源了基于合法数据训练的7B LLM模型Comma v0.1,分别使用1T和2T数据集,基于Llama3架构,目前仅支持英文。团队还提供了训练配置文件和测试方法,期望未来能有更多合法开放的AI模型。
本研究比较了大型语言模型在生物医学文本分类中的表现,结果显示DeepSeekR1在精确度上优于Llama3-70B,但F1分数因任务而异,强调选择模型时需考虑具体需求。
该项目从零实现Meta的Llama3,揭示大型语言模型的内部工作原理。提供双语代码注释、维度跟踪和KV-Cache推导,适合初学者和开发者,帮助深入理解模型设计与推理过程。
抱歉,您提供的文本没有包含可供总结的内容。请提供具体的文章内容,我将为您进行总结。
本文评测了Raspberry Pi 5在运行Ollama和Llama3.2模型时的性能,结果显示使用Argon Neo NVME外壳的Pi 5处理速度良好,适合预算有限的用户,但M系列MacBook/Mac Mini性能更强大。
本文介绍了如何将旧笔记本电脑转变为本地ChatGPT克隆,使用Docker安装Open WebUI,并选择合适的语言模型(如llama3.2:1b),从而轻松搭建本地AI聊天机器人,保护隐私并支持定制与灵活使用。
本研究探讨如何在资源匮乏的巴勒斯坦法律领域有效应用大型语言模型(LLMs)。我们提出了基于Llama-3.2-1B-Instruct的微调模型,利用合成的法律文本数据集,提供可持续且成本效益高的法律指导。实验结果表明,该模型在多种查询中表现良好,推动了AI法律援助工具的发展。
Meta展示了FSDP(完全分片数据并行)如何利用AWS云基础设施提升大规模训练效率。FSDP通过消除冗余,在相同资源下训练更大模型。HSDP(混合分片数据并行)优化通信开销,提升训练性能。SMPv2结合FSDP和张量并行,简化训练配置,降低显存消耗,支持高效的大型模型训练。
本研究提出了一种上下文并行的方法,解决了长上下文大语言模型推理的性能瓶颈。该方法在多达128个H100 GPU和16个节点上实现近线性扩展性,成功在77秒内对Llama3 405B模型进行1M上下文预填充,展现出高效的并行性能。
本研究旨在解决自动医学报告生成(MRG)中存在的效率低下问题。通过采用多模态大型语言模型,结合3D视觉变换器(ViT3D)处理3D扫描,提出了一种新的自动化报告生成方法。实验结果显示,该模型在MRG任务验证集上取得了0.3的平均Green分数,并在视觉问答任务验证集上达到了0.61的准确率,超越了基线模型,验证了ViT3D对LLaMA3的有效对齐在MRG和VQA任务中的潜力。
本应用旨在构建高级数据模型并将其用于摄像头数据的摄入和各种搜索选项。学习数据摄入、数据查找和格式化,将数据存储到Milvus中,使用标量和多个向量字段进行数据模型优化,使用标量和多个向量查询存储在Milvus中的数据,并在笔记本中重新排序最终结果。通过本应用,您将全面了解使用Milvus、半结构化和非结构化数据的数据摄入对象以及使用开源模型构建强大高效的数据检索系统。
Amazon SageMaker是一项机器学习服务,帮助数据科学家和开发人员快速准备机器学习模型。LlamaFactory是一个支持多种微调技术的框架,用于统一高效微调大型语言模型。文章介绍了在Amazon SageMaker上使用LlamaFactory框架训练Llama3的过程,包括构建镜像、训练和部署模型。
字节跳动豆包大模型团队与香港大学合作开发了名为ByteCheckpoint的大模型Checkpointing系统,支持多个训练框架,提升性能和易用性,实验结果表明存储和读取性能显著提升。团队计划扩展系统功能,支持更大规模的GPU集群训练任务和全生命周期的Checkpoint管理。
Meta Llama3 模型微调与推理解决方案提供了一套支持多种训练方法的脚本,适用于摘要生成和问答系统,并展示了在 WhatsApp 和 Messenger 上的应用潜力。VGen 是一个支持多种输入数据的视频生成生态系统,mergekit 用于合并预训练语言模型,支持多种合并方法。Amphion 是音频生成工具包,支持文本转语音等功能。
OpenAI的Scaling Laws被视为大语言模型的摩尔定律。清华大学博士指出,为了提升模型性能,需要增加数据量至少10个数量级。华盛顿大学等机构提出了实验测试平台DCLM,通过固定训练代码,鼓励研究人员提出新的训练集来进行创新。DCLM-BASELINE是一个高质量训练集,通过基于模型的过滤达到了64%的准确性。DCLM提供了新的思考范式和可能性。
上海交通大学生成式人工智能实验室(GAIR Lab)推出了评估大模型诚实性的基准BeHonest,从自我认知、非欺骗性和一致性三个核心维度出发,对9个主流大语言模型进行了评估。结果显示,大多数模型在回答已知问题时表现出色,但在主动承认未知方面存在不足。现有模型存在欺骗倾向,不论指令是否合理。较大模型表现更为稳定。BeHonest的研究为AI诚实性评估提供了依据,呼吁AI社区进一步关注诚实性问题。
LLaMA 3是Meta开源的大模型,相比LLaMA 2在上下文窗口和token数量上有所增加。它采用旋转位置编码(RoPE)和RMSNorm等技术,提升了模型性能和响应多样性,尤其在语言理解和复杂任务处理上表现优异,支持更高效的代码生成。
MAX 24.4版本在MacOS上发布,支持本地生成式AI模型。MAX Pipelines提供本地构建和云端部署生成式AI管道的工具链,具有行业领先的性能和多种功能。
完成下面两步后,将自动完成登录并继续当前操作。