原文中文,约800字,阅读约需2分钟。
📝
内容提要
杜老师最近在Mac上本地运行LLM,避免了调用API的麻烦。经过一周的测试,他总结了四个模型的加载时间和性能。虽然本地运行存在编译工具和内存设置等问题,但4B量化模型足以满足日常调试需求。总体来看,本地运行LLM尚不能完全替代API,但作为辅助工具,杜老师每天都在使用,希望对其他用户有所帮助。
🎯
关键要点
-
杜老师在Mac上本地运行LLM,避免了调用API的麻烦。
-
测试环境为macOS 26.x,内存32GB,使用M系列芯片。
-
测试了4个模型,重点是4B量化、8B量化和13B全精度模型。
-
4B量化模型加载时间为5秒,首次token响应时间为0.3秒;8B量化模型加载时间约15秒,首次token响应时间为0.8秒;13B全精度模型加载时间超过1分钟,首次token响应时间为2.5秒。
-
遇到的困难包括需要安装Xcode工具链、内存映射模型的设置以及温度参数的调整。
-
结论是4B量化模型足以满足日常调试需求,但在需要更长上下文或真正工作场景时,仍需依赖云端API。
🏷️