macOS 终端下本地跑 LLM 实测

macOS 终端下本地跑 LLM 实测

💡 原文中文,约800字,阅读约需2分钟。
📝

内容提要

杜老师最近在Mac上本地运行LLM,避免了调用API的麻烦。经过一周的测试,他总结了四个模型的加载时间和性能。虽然本地运行存在编译工具和内存设置等问题,但4B量化模型足以满足日常调试需求。总体来看,本地运行LLM尚不能完全替代API,但作为辅助工具,杜老师每天都在使用,希望对其他用户有所帮助。

🎯

关键要点

  • 杜老师在Mac上本地运行LLM,避免了调用API的麻烦。

  • 测试环境为macOS 26.x,内存32GB,使用M系列芯片。

  • 测试了4个模型,重点是4B量化、8B量化和13B全精度模型。

  • 4B量化模型加载时间为5秒,首次token响应时间为0.3秒;8B量化模型加载时间约15秒,首次token响应时间为0.8秒;13B全精度模型加载时间超过1分钟,首次token响应时间为2.5秒。

  • 遇到的困难包括需要安装Xcode工具链、内存映射模型的设置以及温度参数的调整。

  • 结论是4B量化模型足以满足日常调试需求,但在需要更长上下文或真正工作场景时,仍需依赖云端API。

🏷️

标签

➡️

继续阅读