小红花·文摘
  • 首页
  • 广场
  • 排行榜🏆
  • 直播
  • FAQ
Dify.AI

本文介绍了多种大型语言模型(LLM)优化技术,如LongMem框架、InfLLM、LLMem、LightSeq和UniMem,旨在提高长文本处理的效率和准确性。研究提出了在有限硬件条件下的微调方案和移动设备上的推理引擎Transformer-Lite,显著提升了推理速度,满足了处理更长输入序列的需求。

高效地使用 8 个 GPU 在 1 百万序列长度上训练 70 亿层次语言模型

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2024-07-16T00:00:00Z

本文介绍了在移动设备上高效部署大型语言模型(LLM)的四种优化技术:动态模型推断、操作符优化、FP4量化和基于子张量的技术,并开发了Transformer-Lite引擎。该引擎显著提升了速度,研究表明量化可以减少内存需求但可能影响准确性。文章还探讨了MobileLLM模型系列在智能手机上进行高效推理的潜力。

利用 MLLM-NPU 设备实现每秒 1000 标记的本地语言模型推理

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2024-07-08T00:00:00Z
  • <<
  • <
  • 1 (current)
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码