小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
Shaun Thomas:开箱即用:用 llama.cpp 在本地为 AI DBA Workbench 提供动力

本文介绍如何用 Docker 搭建 pgEdge AI DBA Workbench 全本地化技术栈,共七个容器:Postgres、负载生成器、llama.cpp 模型服务、工作台服务器、采集器、告警器和客户端。使用 Qwen3.8-27B 推理模型与 nomic-embed-text 嵌入模型,通过 OpenAI 兼容接口调用,无需外部 AI 服务,适合气隙或敏感环境,可低成本实现 Postgres 智能监控与诊断。

Shaun Thomas:开箱即用:用 llama.cpp 在本地为 AI DBA Workbench 提供动力

Planet PostgreSQL Planet PostgreSQL · 2026-09-04T13:48:55Z

DSpark是一种投机解码技术,通过并行草稿与轻量级顺序组件结合,提升LLM生成速度。在llama.cpp中测试Qwen3-8B,启用DSpark后生成速度从95.0提升至124.9 tokens/s,约31.5%加速。尽管MTP更通用,DSpark在草稿质量上占优,但模型支持有限,适合实验。

使用DSpark投机解码加速LLM推理

KDnuggets KDnuggets · 2026-08-31T14:00:00Z
3 张卡到底能不能跑大模型推理?从 vLLM、llama.cpp 到 TensorSharp 的多卡真相 - 张善友

vLLM的并行限制源于注意力头数需被TP大小整除,而非固定1/2/4/8卡;llama.cpp采用层切分,通信量小,卡数影响不大,关键在互联类型。TensorSharp引擎同时支持层切分和张量并行,3卡跑744B模型性能超llama.cpp,但TP对互联敏感,2卡仅提升1.4倍。核心结论:层切分对卡数免疫,TP对互联敏感。

3 张卡到底能不能跑大模型推理?从 vLLM、llama.cpp 到 TensorSharp 的多卡真相 - 张善友

张善友 张善友 · 2026-08-27T22:40:00Z

Muse Glimmer是Meta推出的本地AI编码模型,性能优于Qwen 27B类模型。本文指导用户通过llama.cpp和DFlash加速运行,并连接Pi代理实现本地编码。测试显示速度达127 tokens/秒,能自主构建、测试和调试项目,但HTML生成略逊于Qwen。推荐RTX 3090/4090/5090用户尝试,本地AI编码已接近付费模型体验。

使用llama.cpp、DFlash和Pi运行Muse Glimmer进行本地Vibe编码

KDnuggets KDnuggets · 2026-08-21T14:00:58Z
Ollama vs. LM Studio vs. llama.cpp:2026年你应该使用哪个本地AI运行时?

本文比较了Ollama、LM Studio和llama.cpp三种本地AI运行时。LM Studio适合初学者,提供图形界面和可视化量化控制;Ollama适合开发者,提供简洁CLI和API集成;llama.cpp适合追求极致控制的生产工程师,支持手动量化。三者共享同一推理引擎,用户可按需从LM Studio迁移至Ollama再至llama.cpp。

Ollama vs. LM Studio vs. llama.cpp:2026年你应该使用哪个本地AI运行时?

MachineLearningMastery.com MachineLearningMastery.com · 2026-07-29T12:00:13Z
MTP 加速推理最佳实践:在亚马逊云科技中国区使用 llama.cpp 部署 Qwen3.6 的实测指南

本文在AWS中国区实测llama.cpp部署Qwen3.6模型,对比Graviton4、Intel CPU和A10G GPU的MTP加速效果。GPU上MTP提升83%性能,CPU上反而降低18-40%。最佳实践:GPU用27B Dense+MTP,CPU用35B MoE关闭MTP,后者成本仅为GPU的26%,性能达82%。

MTP 加速推理最佳实践:在亚马逊云科技中国区使用 llama.cpp 部署 Qwen3.6 的实测指南

亚马逊AWS官方博客 亚马逊AWS官方博客 · 2026-07-24T09:24:07Z

本文介绍如何在本地运行Qwythos-9B-Claude-Mythos-5-1M模型,该模型为9B参数推理编码模型,适合消费级硬件。通过llama.cpp安装并启动服务,设置100K上下文和MTP推测解码,在RTX 4070 Ti Super上达到81.74 tokens/秒。随后安装Pi及llama插件,连接本地服务器作为编码代理。测试显示模型能成功构建浏览器游戏和CSV转Excel CLI工具,表现快速准确,无需外部API,适合日常编码任务。

使用llama.cpp和Pi在本地运行Mythos增强编码模型

KDnuggets KDnuggets · 2026-07-21T14:00:42Z

文章揭示了Blackwell架构原生支持INT4满血算力,通过修改cutlass代码或CUBIN后处理,可解锁SM100/SM110及RTX 5090的INT4/E0M3算力,吞吐与FP4 E2M1相当,支持混乘,未来可提升本地llama.cpp推理性能。

从未公开!震惊了!Blackwell 原生支持 INT4 满血算力

千千 千千 · 2026-07-11T12:53:53Z
关于github拉取下载加速的另一个方式

本文讨论了在Mac上使用llama.cpp时下载GitHub仓库速度慢的问题,建议使用gh-proxy服务加速下载,并通过转换链接提高效率。直接下载压缩包比使用git clone更快,因为压缩包减少了小文件传输时间。此外,作者提到在本地运行27B模型时遇到性能问题,考虑购买更高配置的Mac Studio。

关于github拉取下载加速的另一个方式

Nicksxs's Blog Nicksxs's Blog · 2026-06-14T13:45:35Z
6GB 显存运行 64K 上下文:llama.cpp 参数与 KV Cache 调优

文章讨论了在本地运行小型开源模型的可行性,特别是使用llama.cpp项目。作者分享了在Windows上使用3060显卡运行Qwen3.6 9B模型的设置,包括CUDA版本和参数配置。尽管显存有限,这些模型在简单任务中仍能有效使用。

6GB 显存运行 64K 上下文:llama.cpp 参数与 KV Cache 调优

Nicksxs's Blog Nicksxs's Blog · 2026-05-31T14:07:14Z
高性能 LLM 推理框架:纯 C/C++ 实现,支持多硬件平台! | 开源日报 No.786

llama.cpp 是一个高性能的 C/C++ LLM 推理项目,优化了 Apple Silicon 和 x86 架构,支持多种量化选项。Awesome-LLM-3D 汇总了多模态语言模型在三维世界中的应用资源。evcc 是电动汽车充电控制器,支持多种通信协议。生成 AI 文档提供 Google Gemini API 的信息和示例。

高性能 LLM 推理框架:纯 C/C++ 实现,支持多硬件平台! | 开源日报 No.786

开源服务指南 开源服务指南 · 2025-11-11T07:35:12Z
Llama.cpp 和 GGUF 中的多模态嵌入

jina-embeddings-v4推出了先进的多模态嵌入,支持文本、图像和复杂文档的向量搜索。通过修改llama.cpp,实现了多模态嵌入的生成,解决了图像处理和注意力机制的问题。调试后,llama.cpp模型的嵌入结果与参考模型相近,未来可优化视觉编码器和支持多向量嵌入。

Llama.cpp 和 GGUF 中的多模态嵌入

Jina AI Jina AI · 2025-09-09T23:33:16Z
在本地运行GPT-OSS的最佳方式

本文介绍了如何在本地高效运行GPT-OSS 20B模型,使用llama.cpp和Open WebUI。通过简单的命令设置Python环境、安装必要的包、下载量化模型并启动服务器,用户可轻松获得现代聊天界面,实现本地推理。

在本地运行GPT-OSS的最佳方式

KDnuggets KDnuggets · 2025-08-25T14:00:04Z
使用 llama.cpp 构建 AI 代理

本文介绍了如何在本地设置和运行 llama.cpp 服务器,构建并测试 AI 代理。教程包括安装、配置和编译 llama.cpp,集成 Langchain,以及创建支持网络搜索和 Python REPL 的 ReAct 代理。尽管设置过程复杂,但其高效性和灵活性使本地 AI 成为可能。

使用 llama.cpp 构建 AI 代理

KDnuggets KDnuggets · 2025-06-24T12:00:55Z
在Python中使用llama.cpp构建检索增强生成(RAG)管道

本文介绍了如何在Python中使用llama.cpp构建检索增强生成(RAG)管道。用户需安装必要库并下载LLaMA模型,创建文档库,处理多种格式的文档并分割成可管理的块。接着,使用Chroma构建向量存储,结合检索和生成方法,最终实现高效的RAG系统,能够根据用户查询生成准确回答并提供相关文档来源。

在Python中使用llama.cpp构建检索增强生成(RAG)管道

MachineLearningMastery.com MachineLearningMastery.com · 2025-04-18T17:35:07Z

本文介绍了开源大模型的最新进展,特别是DeepSeek-R1的推出,标志着开源模型逐渐追赶闭源模型。文章讨论了本地大模型的推理框架、应用及生态,强调了llama.cpp项目的硬件支持和量化策略。通过Ollama和Open WebUI,用户可以更方便地使用大模型,进行联网搜索和本地知识库增强,提升应用体验。

本地大模型之路(三):推理引擎和 LLM 应用

少数派 少数派 · 2025-03-11T07:00:00Z
用 Ollama?其實你在跑 llama.cpp!學會直接使用它,發揮更強性能!

Ollama 允许用户在本地运行大型语言模型,提供模型托管服务。核心技术为 llama.cpp,支持 GGUF 模型格式。指南介绍如何在 Jetson Orin Nano 上编译 llama.cpp、转换 GGUF 模型并进行量化,以提高推理速度和减少内存占用。完成模型准备后即可进行推理。

用 Ollama?其實你在跑 llama.cpp!學會直接使用它,發揮更強性能!

DEV Community DEV Community · 2025-03-05T23:00:00Z
使用OpenWebUI和Llama.cpp实现DeepSeek-R1工具调用以构建本地AI工作流程

最新AI技术进展为开发者带来好消息,llama.cpp团队合并了支持DeepSeek-R1工具调用的关键请求,消除了本地部署障碍。结合OpenWebUI和llama.cpp,可创建全面的本地AI工作流程,如自动校对。新功能包括结构化输出、多工具协调和错误恢复,建议使用RTX 3090或双RTX 4090显卡。

使用OpenWebUI和Llama.cpp实现DeepSeek-R1工具调用以构建本地AI工作流程

DEV Community DEV Community · 2025-02-01T04:58:32Z
如何在内存有限的MacBook Air M1上高效运行Meta LLaMA

在MacBook上运行Meta的LLaMA模型是可行的。通过下载模型、安装必要的包,并使用llama.cpp进行量化,可以在M1的8GB内存上高效运行AI应用。主要步骤包括安装llama.cpp、量化模型和通过命令行运行。

如何在内存有限的MacBook Air M1上高效运行Meta LLaMA

DEV Community DEV Community · 2024-12-06T15:16:20Z

本文探讨了大语言模型(LLM)的快速发展及其本地运行的优势,如隐私保护和无注册限制。作者分享了使用llama.cpp软件的经验,介绍了多种模型的特点与应用。尽管LLM在生成代码和文本方面表现出色,但仍存在准确性和上下文长度的限制。总体而言,LLM在校对、创作和翻译等领域展现了潜力。

译文 | 百舸争流,能者自渡:本地大语言模型(LLM)那些事

少数派 少数派 · 2024-12-05T07:00:00Z
  • <<
  • <
  • 1 (current)
  • 2
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码