LFM2.5-2.6B是面向端侧部署的轻量级AI推理模型,支持128K长上下文和智能体工具调用,性能可与大4倍参数模型竞争。在Apple M5 Max上推理速度达220 tok/s,AMD Ryzen CPU上113 tok/s,内存占用低于2.5GB,平衡了轻量化与高性能。HyperAI官网已上线该模型,并提供相关数据集、教程和百科词条更新。
清华大学与面壁智能推出的MiniCPM-V 4.0模型,参数减少至4.1B,提升了移动端图像理解能力,并支持iOS应用,推动了端侧部署的广泛应用。
PaddleX 3.0-beta1版本在AI模型部署方面进行了重要升级,提供高性能推理、服务化部署和端侧部署解决方案,以满足多样化的应用需求。高性能推理插件提升了模型推理速度,服务化部署增强了系统灵活性,端侧部署支持在用户设备上运行,确保快速响应和隐私保护。
完成下面两步后,将自动完成登录并继续当前操作。