内容提要
Liquid AI发布LFM2.5-VL-3B,31亿参数视觉语言模型,专为设备端设计,支持屏幕理解、函数调用、锚定和多图像输入。在28项基准测试中平均得分69.4,与4.7B模型相当。内存占用约3GB,解码速度228 tok/s。许可证对年收入低于1000万美元的公司免费,高收入需商业许可。
延伸解读
设备端部署的实用门槛
模型约占用3GB内存,在Apple M5 Max上解码速度达228 tok/s,但在Galaxy S26 Ultra上仅20 tok/s。这意味着实际部署时,推理速度高度依赖硬件,移动端可能无法满足实时交互需求。开发者需根据目标设备的算力评估是否适合直接部署,或考虑量化、剪枝等优化手段。
许可证的“收入门槛”陷阱
LFM开源许可证基于Apache 2.0,但商业使用免费仅限年收入低于1000万美元的公司。一旦企业收入超过该阈值,必须与Liquid AI协商商业许可。这要求企业在采用模型前,需明确自身收入规模及未来增长预期,避免因业务扩张而突然面临授权费用或合规风险。
屏幕理解与函数调用的实际价值
该模型在ScreenSpot-v2上得分80.7,显著高于Gemma-4-E4B(51.2),且函数调用能力从26.4提升至59.5(ToolSandbox)。这使其在GUI自动化测试、屏幕代理等场景中具备实用潜力。但函数调用得分仍低于屏幕理解,说明工具调用可靠性可能仍需验证,建议在关键任务中设置人工兜底。
Q&A
LFM2.5-VL-3B是什么?
LFM2.5-VL-3B是Liquid AI发布的一款31亿参数的视觉语言模型,专为设备端部署设计,能读取屏幕、识别物体并调用工具。
LFM2.5-VL-3B在基准测试中的表现如何?
在28项视觉基准测试中平均得分69.4,与InternVL-3.5-4B持平,比Qwen3.5-4B低0.7分,但参数量更少(31亿 vs 47亿)。
LFM2.5-VL-3B的许可证有什么限制?
基于Apache 2.0,但年收入超过1000万美元的公司需商业许可;低于此收入的开发者、初创公司可免费商用,研究、教育、非营利用途不受限。
LFM2.5-VL-3B支持哪些部署格式和运行时?
提供原生、GGUF、ONNX、MLX四种格式,支持llama.cpp、MLX、vLLM、SGLang、ONNX运行时。
LFM2.5-VL-3B相比上一代有哪些改进?
屏幕理解(ScreenSpot-v2从57.1升至80.7)、锚定(RefCOCO从57.1升至87.9)、新增函数调用(ToolSandbox从26.4升至59.5)、多图像输入(BLINK从50.2升至61.5)。
LFM2.5-VL-3B的硬件需求如何?
内存占用约3GB,在Apple M5 Max上解码速度228 tok/s,在Galaxy S26 Ultra上为20 tok/s。
LFM2.5-VL-3B有哪些应用场景?
设备端屏幕代理、GUI测试自动化、PDF转结构化文本、发票OCR、车辆物体检测、离线翻译、多图像比较等。