小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
吹爆开源!RunningHub让MiniMax H3满血提速12倍,本地部署照样起飞

RunningHub 为 MiniMax H3 开源模型推出 H3 Lightning 加速方案,结合后训练加速模型、SageAttention2、Cache-DiT、torch.compile 及 TP2+Ulysses4 多卡并行,在无 NVLink 的 PCIe 多卡环境下实现约 12 倍提速,5 秒视频生成时间从 348.8 秒降至 28.7 秒,并保留 BF16 精度。该方案已开源,可降低创作者试错成本。

吹爆开源!RunningHub让MiniMax H3满血提速12倍,本地部署照样起飞

量子位 量子位 · 2026-09-11T00:55:01Z
AI本地部署不如官方版的元凶找到了:734个依赖包,每一个都可能坑

推理软件栈的微小差异(如注意力后端、KV缓存量化、权重量化、张量并行度)会导致本地部署的大模型在长上下文中输出不同token,甚至工具调用失败。实验显示,INT4 KV缓存和NVFP4量化翻转率最高,而BF16和特定INT8方案更稳定。这些数值漂移累积后,模型可能做出致命错误决策,且难以排查。

AI本地部署不如官方版的元凶找到了:734个依赖包,每一个都可能坑

量子位 量子位 · 2026-08-29T13:11:08Z
本地工具调用对比:Gemma 4 vs. Llama 3 vs. Mistral

本文比较了Gemma 4、Llama 3和Mistral三种本地部署模型的工具调用功能。Gemma 4原生支持工具调用,适合边缘设备;Llama 3生态丰富,社区支持强;Mistral效率高,适合硬件受限场景。三者均通过JSON格式实现工具调用,但各有优劣,选择取决于硬件和部署需求。

本地工具调用对比:Gemma 4 vs. Llama 3 vs. Mistral

MachineLearningMastery.com MachineLearningMastery.com · 2026-08-25T12:00:21Z
Pi Agent + DeepSeek 深度优化

文章介绍了使用两台懒猫AI算力舱本地部署DeepSeek模型的优化过程。通过调整上下文长度至328K、开启思考模式及工具调用功能,提升了模型性能,实现每秒60 tokens的速度,并强调成本极低,每天仅需1.9元,堪称最便宜的DeepSeek方案。

Pi Agent + DeepSeek 深度优化

Andy Stewart Andy Stewart · 2026-08-21T16:00:00Z
如何以最少资源构建稳健的RAG系统

本文介绍如何在普通笔记本电脑上构建无需云端的RAG系统。核心方法包括:量化模型降低内存占用、使用紧凑嵌入模型和本地向量存储。系统涵盖文档分块、嵌入索引、检索和本地生成等步骤。可靠性通过引用来源、相似度阈值、评估集和查询日志实现。推荐使用llama.cpp、LangChain、FAISS等轻量工具,并建议从小规模开始逐步调优。

如何以最少资源构建稳健的RAG系统

MachineLearningMastery.com MachineLearningMastery.com · 2026-08-20T12:00:21Z
Siperb 的 Go 语言媒体桥接器:让 WebRTC 软电话与本地部署 PBX 对接

Siperb 推出本地媒体桥接器,使桌面客户端无需公网或云路由即可连接客户本地 PBX。该组件用 Go 编写,在用户端终结 WebRTC,转为 SIP 明文媒体,避免部署硬件 SBC。首个版本两天内由 AI 辅助开发完成,创始人认为本地部署客户应获针对性服务,而非强制迁移上云。

Siperb 的 Go 语言媒体桥接器:让 WebRTC 软电话与本地部署 PBX 对接

实时互动网 实时互动网 · 2026-08-20T03:14:10Z
两块RTX 3090跑105 tok/s!Qwen3.8-27B本地部署实测

阿里开源Qwen3.8-27B模型,270亿参数,支持262K上下文,性能接近闭源旗舰。社区实测在双RTX 3090上达105 tok/s,通过量化、MTP加速等技术实现。模型Apache 2.0协议,48小时下载86万次。但速度受场景、配置影响大,多卡未必更快,且长上下文需量化KV缓存牺牲质量。

两块RTX 3090跑105 tok/s!Qwen3.8-27B本地部署实测

极道 极道 · 2026-08-17T04:23:00Z
Mac mini本地部署Hermes+Qwen3.8:慢30倍却省爆!

本地AI代理实验:用户用799美元Mac mini M4 24GB运行Hermes Agent和Qwen3.8-27B模型,夜间花1小时42分钟生成AI新闻播报,全程本地推理、零API费用。对比RTX 5090,速度慢30倍但成本低,电费不足一美分。文章分析显性成本(硬件、电费)与隐性成本(调试时间、折旧、机会成本),并质疑模型基准真实性,探讨速度与数据主权的权衡。

Mac mini本地部署Hermes+Qwen3.8:慢30倍却省爆!

极道 极道 · 2026-08-17T00:28:00Z
Meta 发布 Muse Glimmer,称其为 300 亿开放代理模型

Meta Superintelligence Labs发布新一代开源大语言模型Muse Glimmer,拥有300亿参数,可在单个消费级GPU上运行,适用于本地编码代理和多步骤推理等任务。模型权重采用Apache 2.0许可证,支持本地部署,可从Hugging Face下载,ollama 0.32.7已更新支持。

Meta 发布 Muse Glimmer,称其为 300 亿开放代理模型

实时互动网 实时互动网 · 2026-08-11T02:01:33Z
HuggingFace 开源speech-to-speech,支持本地部署

HuggingFace发布开源语音智能体流水线speech-to-speech,完全模块化,支持本地运行,无需API密钥。它通过Silero VAD、Parakeet TDT、Gemma 4和Qwen3-TTS等组件实现语音检测、转写、生成和合成,提供与OpenAI Realtime兼容的WebSocket API,可无缝替换,支持多语言和多种运行模式。

HuggingFace 开源speech-to-speech,支持本地部署

实时互动网 实时互动网 · 2026-08-10T02:09:35Z
8GB 内存也能跑 Kimi K3?2026 本地部署大模型配置全指南

2026年本地部署大模型趋势显示,万亿参数模型如Kimi K3可通过流式加载在8GB内存CPU上运行,但速度极慢。部署关键取决于显存容量和内存带宽,8GB适合小模型,80GB以上可运行120B模型。DeepSeek V4 Flash经量化可在128GB内存设备运行。工具选择上,LM Studio适合新手,Ollama适合开发者,llama.cpp提供精细控制。本地部署需权衡成本、速度与隐私。

8GB 内存也能跑 Kimi K3?2026 本地部署大模型配置全指南

爱范儿 爱范儿 · 2026-08-05T06:23:46Z

中国开源模型竞争激烈,DeepSeek、Minimax、Qwen等相继发布新品,但Reddit评论揭示真相:Minimax的H3是视频模型,非语言模型,且8GB显存可运行;Qwen团队曾解散,3.8回归受期待。社区关注本地部署、权重开放和实测性能,而非“最强”营销词,强调尺寸细分下的真实竞争。

幽默图:中国开源模型霸占了这几天AI头条

极道 极道 · 2026-08-03T23:53:00Z
Qwen3.8-Max开源双炸:2.4万亿参数免费公开,27B模型专攻消费级显卡

通义千问开源Qwen3.8-Max和27B模型,前者拥有2.4万亿参数并免费公开,后者适配消费级显卡。Max版展示了自主编码和芯片设计能力,27B使本地部署接近顶级AI,降低了开发成本。此举打破闭源垄断,推动行业生态加速,引发社区热议。

Qwen3.8-Max开源双炸:2.4万亿参数免费公开,27B模型专攻消费级显卡

极道 极道 · 2026-08-03T03:49:00Z
“我们喜欢两者兼用的世界”:英伟达如何看待本地模型与前沿模型

英伟达高管康威指出,本地与开源模型正与前沿模型协同工作,通过路由器按任务复杂度分配,以降低成本和时间。企业可微调开源模型以掌控数据,如DGX Spark支持本地运行大模型,结合云端前沿模型,实现高效灵活的AI部署。

“我们喜欢两者兼用的世界”:英伟达如何看待本地模型与前沿模型

The New Stack The New Stack · 2026-07-23T18:12:41Z
把 Fable 5 装进 MacBook,还要多久

Fable 5 的下线时间延长至12号,用户对端侧 AI 的期待不断增加。高通和苹果等芯片厂商正在重构硬件以支持本地 AI,推出更强大的处理器和架构。新模型如 Google 的 Gemma 4 和阿里的 Qwen3.6 降低了本地部署的门槛。尽管本地 AI 前景光明,但硬件成本、功耗和权限管理等问题仍需解决。

把 Fable 5 装进 MacBook,还要多久

爱范儿 爱范儿 · 2026-07-08T09:31:36Z
本地开发新宠:阿里Qwen 3.6 27B本地部署性能实测与体验

阿里Qwen 3.6 27B本地模型在笔记本上运行表现出色,生成代码和创意写作效果接近顶级API。尽管运行时电脑发热严重,但其性能和数据安全性使得本地部署成为理想选择。用户认为该模型适合简单开发任务,但在复杂项目中表现有限。整体来看,Qwen 3.6 27B是本地开发的强大工具。

本地开发新宠:阿里Qwen 3.6 27B本地部署性能实测与体验

极道 极道 · 2026-06-29T22:48:00Z
本地部署Gemma4-26B-A4B模型

本文介绍了在RTX4060上本地部署Gemma4-26B-A4B模型的过程与效果。通过Q8缓存量化和MTP加速,模型输出速度可达40 tokens/s。尽管在翻译和数学问题上表现一般,但在SQL测试中与其他模型相当。文章还讨论了模型的参数设置及其对性能的影响。

本地部署Gemma4-26B-A4B模型

如鱼饮水 如鱼饮水 · 2026-06-29T00:21:06Z
公共云与本地部署:关于各类工作负载归属的峰会

随着云计算的发展,许多公司开始质疑“云优先”策略。云服务费用上升,企业考虑将部分工作负载迁回本地以降低成本和简化管理。专家建议合理分配工作负载,避免高额账单。

公共云与本地部署:关于各类工作负载归属的峰会

The New Stack The New Stack · 2026-06-26T00:09:24Z
一千台599美元Mac mini替代H100跑大模型:便宜十倍

一千台599美元的Mac mini可以替代昂贵的H100服务器,具有低成本和低功耗的优势。Mac mini的统一内存架构提升了AI模型的运行效率,适合本地部署。相比之下,云服务费用高昂,使用Mac mini搭建AI服务器简单易行,能有效节省成本。

一千台599美元Mac mini替代H100跑大模型:便宜十倍

极道 极道 · 2026-06-03T22:26:00Z
本地部署 Hy-MT2 翻译模型

腾讯于2026年开源了Hy-MT2翻译模型,支持本地部署,分为1.8B和7B两种尺寸,适合网页和PDF翻译。测试显示,7B模型在翻译质量上优于1.8B模型,尤其在使用Q4缓存量化时表现更佳。用户可通过调整参数和使用不同翻译插件来优化翻译效果。

本地部署 Hy-MT2 翻译模型

如鱼饮水 如鱼饮水 · 2026-06-02T00:40:39Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码