内容提要
文章介绍了使用两台懒猫AI算力舱本地部署DeepSeek模型的优化过程。通过调整上下文长度至328K、开启思考模式及工具调用功能,提升了模型性能,实现每秒60 tokens的速度,并强调成本极低,每天仅需1.9元,堪称最便宜的DeepSeek方案。
延伸解读
显存利用与上下文长度
文章提到将上下文长度从131K提升至328K,同时每台算力舱显存占用从100GB增至约120GB,剩余7~9GB。这一调整充分利用了闲置显存,但需注意显存余量减少可能影响长时间运行的稳定性。作者特意保留少量显存,以保障7x24小时运行,说明在追求更大上下文时需平衡性能与稳定性。
思考模式与工具调用的实际意义
开启思考模式(think:high)后,DeepSeek的推理能力增强,类似GPT Max模式,适合复杂任务。同时,默认启用工具调用(--enable-auto-tool-choice)使Pi Agent能自动调用工具,实现“yolo模式”,减少人工干预。这两项优化显著提升了自动化程度,但需注意思考模式可能增加计算负载,影响生成速度。
成本与性能的权衡
文章强调每天24小时满负荷运行成本仅1.9元,且生成速度达每秒60 tokens,优于许多国产在线模型。但需注意,该成本基于本地部署的算力舱,未包含硬件购置或维护费用。对于已有设备的用户,边际成本极低,但新用户需考虑初始投资。
Q&A
如何优化Pi Agent中DeepSeek的上下文长度?
通过调整DeepSeek的max-model-len和kv-cache-memory-bytes参数,将上下文长度从131K提升到328K,充分利用每台算力舱剩余的显存,同时保留7~9GB显存以确保7x24小时运行的稳定性。
Pi Agent中如何切换DeepSeek的思考模式?
通过开启DeepSeek的--reasoning-parser参数,在Pi Agent中可以使用Shift+Tab快捷键快速切换思考模式,切换到think:high模式后,DeepSeek会进入更聪明的状态,类似GPT Max模式。
为什么需要默认打开DeepSeek的工具调用功能?
因为如果不开启--enable-auto-tool-choice参数,Pi Agent无法使用DeepSeek自动调用工具的能力,导致模型在回答几个问题后就会停止。开启后,Pi Agent配合DeepSeek可以进入yolo模式,只需许愿,AI就能自动完成剩余工作。
使用两台懒猫AI算力舱本地部署DeepSeek的推理速度是多少?
优化后,每秒可以生成60个tokens,速度非常快,甚至超过许多国产模型的在线版本。
两台懒猫AI算力舱本地部署DeepSeek的每日成本是多少?
即使24小时100%负荷运行,一天的成本也仅为1.9元,被认为是世界上最便宜的DeepSeek方案。
优化过程中如何保证系统长时间运行的稳定性?
在调整上下文长度时,特意保留每台算力舱7~9GB的显存余量,以确保7x24小时运行的稳定性。