新 Mac mini 首发实测:我的第一台「多 Agent」电脑

新 Mac mini 首发实测:我的第一台「多 Agent」电脑

💡 原文中文,约5500字,阅读约需14分钟。
📝

内容提要

Mac mini 正成为“AI PC”代表,适合全天候运行智能体。实测 M5 Pro 48GB 版可流畅运行200亿至300亿参数本地模型,并支持多个 Agent 同时写代码、整理资料、建模渲染。它并非重型 GPU 工作站,但作为常开的 Agent 服务器,契合多 Agent 并行的新电脑用法。

🔎

延伸解读

本地大模型的舒适区与边界

实测表明,M5 Pro 48GB 的 Mac mini 在运行 200 亿至 300 亿参数模型时较为流畅,例如 270 亿参数模型生成速度约 41 token/s,处理长文档也有 32 token/s。但面对 700 亿参数模型,速度骤降至 0.05 token/s,基本不可用。这说明其定位是轻量级本地推理,而非重型模型工作站。

GGUF 与 MLX:格式选择影响体验

文章提到,同一模型可制成 GGUF 或 MLX 版本。GGUF 跨平台兼容性好,MLX 则针对 Apple Silicon 优化,利用统一内存。但实际速度与内存占用取决于模型和运行时版本,并非 MLX 一定更快。用户需根据具体模型和工具链选择,不能一概而论。

多 Agent 并行:新用法对内存的真实需求

文章强调,Mac mini 的价值在于同时服务多个后台 Agent。例如一个 Agent 写代码、一个编译 Chromium、一个处理 100GB 数据、一个控制 Blender 渲染,同时本地模型常驻内存。48GB 统一内存正是为这种多 Agent 场景预留空间,而非单个 Agent 消耗。这改变了传统多任务的定义。

视频生成等重型任务的性能局限

在 MiniMax H3 视频生成测试中,15 秒视频耗时近 90 分钟,5 秒视频也需 18 分钟,且机器发热、风扇噪音明显。这表明 Mac mini 不适合承担大型视频生成或训练任务。若需要此类重型 AI 计算,它无法替代高性能 GPU 工作站。

Q&A

新 Mac mini 为什么被称为适合运行 AI Agent 的电脑?

因为它可以全天候运行,体积小、无电池,适合一直开着;同时拥有足够的内存和算力,能同时服务多个后台工作的 Agent,苹果也将其描述为可全天候运行智能体的桌面电脑。

M5 Pro 48GB 的 Mac mini 能流畅运行多大参数量的本地大模型?

舒适区在 200 亿到 300 亿参数附近的大模型,也可以尝试 330 亿参数的 MiniMax H3 用于视频生成。

在 Mac mini 上运行 70B 的 Llama 3.1 模型体验如何?

虽然能跑,但速度极慢。实测发送一句“你好”,总用时 2 分 48 秒,平均生成速度仅 0.05 Token/s。

GGUF 和 MLX 两种模型格式在 Mac 上有什么区别?

GGUF 是模型文件格式,支持多种硬件,跨平台方便;MLX 是苹果开发的机器学习框架,围绕 Apple Silicon 设计,利用统一内存架构。具体哪个更快、更省内存取决于模型和运行时版本。

用 Mac mini 做视频生成这类重型 AI 计算表现怎么样?

压力很大,机器会变烫、风扇声明显。实测生成 15 秒视频跑了近 90 分钟,5 秒视频用时 18 分钟。它不适合承担大型视频生成、训练等重型 AI 计算,定位不是高性能 GPU 工作站。

Mac mini 作为 Agent 服务器,实际能同时处理哪些任务?

可以同时运行多个 Agent,例如一个在 Xcode 里写 App,一个后台编译 Chromium 内核,一个处理 100GB 数据,另一个控制 Blender 建模和渲染,同时轻量本地模型常驻内存等待调用。

🏷️

标签

➡️

继续阅读