内容提要
BaseRT是专为Apple Silicon优化的本地AI推理引擎,在M5 Pro上提示词处理速度最高达llama.cpp的6.4倍、MLX的3.9倍,生成速度也有提升。它利用M5的Tensor Core和Metal 4 API加速,支持Qwen、Llama等模型,提供安装、下载、对话及API服务。
延伸解读
性能提升的适用场景
BaseRT 的性能优势主要体现在 Prefill(提示词处理)阶段,最高可达 llama.cpp 的 6.4 倍,而 Decode(生成)阶段提升相对较小,最高 1.75 倍。这意味着对于需要处理长提示词或大量输入的场景,如文档分析、代码理解等,BaseRT 能显著缩短等待时间;而对于纯文本生成,提升幅度有限。用户可根据自身需求选择是否采用。
硬件与软件协同优化
BaseRT 的加速并非仅靠芯片性能,而是充分利用了 Apple Silicon 的硬件特性,特别是 M5 芯片的 Tensor Core 架构和 Metal 4 Tensor API。这表明在本地 AI 推理中,软件对硬件的适配程度至关重要。对于使用旧款 Mac 的用户,由于缺乏这些新特性,可能无法获得同等性能提升,需注意硬件限制。
模型支持与兼容性
BaseRT 支持 Qwen、Llama、Gemma 等多个系列模型,覆盖 0.6B 到 35B 参数规模,并提供了 OpenAI 兼容的 API 接口,便于集成到现有应用中。但测试数据基于 M5 Pro 和 48GB 内存,不同配置下性能可能有所差异。用户在选择模型时,应结合自身设备内存和算力,避免因模型过大导致性能下降。
Q&A
BaseRT是什么?它有什么特点?
BaseRT是一款专为Apple Silicon优化的本地AI推理引擎,可以运行Qwen、Llama、Gemma等多种开源模型。它的特点是利用Apple Silicon的硬件特性(如M5的Tensor Core和Metal 4 API)来提升推理速度,在M5 Pro上提示词处理速度最高可达llama.cpp的6.4倍、MLX的3.9倍,生成速度也有提升。
BaseRT在M5 Pro上比llama.cpp和MLX快多少?
在M5 Pro上,BaseRT的提示词处理速度(Prefill)最高可达llama.cpp的6.4倍、MLX的3.9倍;生成速度(Decode)最高可达llama.cpp的1.75倍、MLX的1.33倍。
如何安装和使用BaseRT?
安装:在终端运行 `curl -LsSf https://basecompute.co/install.sh | sh`。下载模型:`basert pull Qwen/Qwen3-4B`。对话:`basert chat Qwen/Qwen3-4B`。启动API服务:`basert serve Qwen/Qwen3-4B --port 8080`,然后可通过OpenAI兼容接口 `http://localhost:8080/v1` 访问。
BaseRT为什么能跑得更快?
BaseRT的优化重点是利用Apple Silicon的硬件特性,特别是M5新增的Tensor Core架构和Metal 4 Tensor API提供的底层计算能力,从而获得明显的性能提升。
BaseRT支持哪些模型?
BaseRT支持Qwen、Llama、Gemma等多种开源模型,并在Qwen3、Qwen3.5、Qwen3.6、Llama 3.2、Gemma 4等模型上进行了测试,覆盖0.6B到35B参数规模。
BaseRT的API服务是否兼容OpenAI?
是的,BaseRT启动API服务后,会提供OpenAI兼容接口,地址为 `http://localhost:8080/v1`。