小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
纯 .NET 手写 CUDA kernel,GLM-5.3-Flash decode 跑出 llama.cpp 的 2 倍 - 张善友

TensorSharp 是纯 .NET LLM 推理引擎,三天内接入 GLM-5.3-Flash 和 Qwen3.8-Flash-Next 新架构。它支持进程内推理,性能上 decode 速度翻倍,prefill 持平,并强调正确性验证和部署便捷性。对 .NET 团队,这标志着前沿模型架构跟进加速,值得纳入 PoC 评估。

纯 .NET 手写 CUDA kernel,GLM-5.3-Flash decode 跑出 llama.cpp 的 2 倍 - 张善友

张善友 张善友 · 2026-08-28T23:54:00Z
3 张卡到底能不能跑大模型推理?从 vLLM、llama.cpp 到 TensorSharp 的多卡真相 - 张善友

vLLM的并行限制源于注意力头数需被TP大小整除,而非固定1/2/4/8卡;llama.cpp采用层切分,通信量小,卡数影响不大,关键在互联类型。TensorSharp引擎同时支持层切分和张量并行,3卡跑744B模型性能超llama.cpp,但TP对互联敏感,2卡仅提升1.4倍。核心结论:层切分对卡数免疫,TP对互联敏感。

3 张卡到底能不能跑大模型推理?从 vLLM、llama.cpp 到 TensorSharp 的多卡真相 - 张善友

张善友 张善友 · 2026-08-27T22:40:00Z
本地工具调用对比:Gemma 4 vs. Llama 3 vs. Mistral

本文比较了Gemma 4、Llama 3和Mistral三种本地部署模型的工具调用功能。Gemma 4原生支持工具调用,适合边缘设备;Llama 3生态丰富,社区支持强;Mistral效率高,适合硬件受限场景。三者均通过JSON格式实现工具调用,但各有优劣,选择取决于硬件和部署需求。

本地工具调用对比:Gemma 4 vs. Llama 3 vs. Mistral

MachineLearningMastery.com MachineLearningMastery.com · 2026-08-25T12:00:21Z

Muse Glimmer是Meta推出的本地AI编码模型,性能优于Qwen 27B类模型。本文指导用户通过llama.cpp和DFlash加速运行,并连接Pi代理实现本地编码。测试显示速度达127 tokens/秒,能自主构建、测试和调试项目,但HTML生成略逊于Qwen。推荐RTX 3090/4090/5090用户尝试,本地AI编码已接近付费模型体验。

使用llama.cpp、DFlash和Pi运行Muse Glimmer进行本地Vibe编码

KDnuggets KDnuggets · 2026-08-21T14:00:58Z
NIGHTRUN – 无需操作系统,用 U 盘启动的的本地大模型客户端

NIGHTRUN是一个极客项目,可直接从U盘通过UEFI启动进入本地大模型对话界面,无需操作系统,支持Llama等模型,纯CPU运行。开发者称其为技术炫技,实际价值有限。若未来支持GPU或内嵌大模型的CPU普及,可能更具实用性。

NIGHTRUN – 无需操作系统,用 U 盘启动的的本地大模型客户端

小众软件 小众软件 · 2026-08-06T08:32:04Z
纯 C# 追平 llama.cpp?.NET 本地推理三国杀 - 张善友

2026年,.NET生态出现三个本地大模型推理引擎:LLamaSharp借力llama.cpp,性能稳定但依赖原生库;dotLLM纯C#实现,CPU解码追平C++,但预填充慢,零原生依赖;TensorSharp融合GGML内核,GPU吞吐领先,支持多模态和集群。三者各具优势,求稳选LLamaSharp,求纯选dotLLM,求全选TensorSharp,C#本地推理已成熟。

纯 C# 追平 llama.cpp?.NET 本地推理三国杀 - 张善友

张善友 张善友 · 2026-08-02T23:08:00Z
Ollama vs. LM Studio vs. llama.cpp:2026年你应该使用哪个本地AI运行时?

本文比较了Ollama、LM Studio和llama.cpp三种本地AI运行时。LM Studio适合初学者,提供图形界面和可视化量化控制;Ollama适合开发者,提供简洁CLI和API集成;llama.cpp适合追求极致控制的生产工程师,支持手动量化。三者共享同一推理引擎,用户可按需从LM Studio迁移至Ollama再至llama.cpp。

Ollama vs. LM Studio vs. llama.cpp:2026年你应该使用哪个本地AI运行时?

MachineLearningMastery.com MachineLearningMastery.com · 2026-07-29T12:00:13Z
MTP 加速推理最佳实践:在亚马逊云科技中国区使用 llama.cpp 部署 Qwen3.6 的实测指南

本文在AWS中国区实测llama.cpp部署Qwen3.6模型,对比Graviton4、Intel CPU和A10G GPU的MTP加速效果。GPU上MTP提升83%性能,CPU上反而降低18-40%。最佳实践:GPU用27B Dense+MTP,CPU用35B MoE关闭MTP,后者成本仅为GPU的26%,性能达82%。

MTP 加速推理最佳实践:在亚马逊云科技中国区使用 llama.cpp 部署 Qwen3.6 的实测指南

亚马逊AWS官方博客 亚马逊AWS官方博客 · 2026-07-24T09:24:07Z

本文介绍如何在本地运行Qwythos-9B-Claude-Mythos-5-1M模型,该模型为9B参数推理编码模型,适合消费级硬件。通过llama.cpp安装并启动服务,设置100K上下文和MTP推测解码,在RTX 4070 Ti Super上达到81.74 tokens/秒。随后安装Pi及llama插件,连接本地服务器作为编码代理。测试显示模型能成功构建浏览器游戏和CSV转Excel CLI工具,表现快速准确,无需外部API,适合日常编码任务。

使用llama.cpp和Pi在本地运行Mythos增强编码模型

KDnuggets KDnuggets · 2026-07-21T14:00:42Z
在 llama-server 中的采样参数

本文讨论了通过调整 llama.cpp 的采样参数(如温度、TopP、MinP、TopK)来提高模型推理速度和效果,减少重复、幻觉和语法降解。强调现代采样方法(如 DRY、XTC 和 Mirostat)的优势,合理配置可显著提升本地模型的生成质量和效率。

在 llama-server 中的采样参数

Alex Ewerlöf Notes Alex Ewerlöf Notes · 2026-07-01T18:28:35Z
6GB 显存运行 64K 上下文:llama.cpp 参数与 KV Cache 调优

文章讨论了在本地运行小型开源模型的可行性,特别是使用llama.cpp项目。作者分享了在Windows上使用3060显卡运行Qwen3.6 9B模型的设置,包括CUDA版本和参数配置。尽管显存有限,这些模型在简单任务中仍能有效使用。

6GB 显存运行 64K 上下文:llama.cpp 参数与 KV Cache 调优

Nicksxs's Blog Nicksxs's Blog · 2026-05-31T14:07:14Z
C# 结合 llama.cpp 实现 QianfanOCR本地部署,搞定所有卡证识别与结构化输出

Qianfan-OCR是一个本地OCR解决方案,旨在提高文档处理效率并保护数据隐私。该模型集成了文档解析、文字识别和语义理解,支持复杂结构的识别,适合企业使用。用户可通过C# WinForm和llama.cpp在本地完成OCR任务,确保敏感数据安全。

C# 结合 llama.cpp 实现 QianfanOCR本地部署,搞定所有卡证识别与结构化输出

dotNET跨平台 dotNET跨平台 · 2026-05-12T23:58:54Z
C# 结合 llama.cpp 实现 PaddleOCR-VL-1.5:本地 OCR 客户端开发全攻略

本文介绍了如何使用C# WinForm结合PaddleOCR-VL-1.5模型,构建一个本地离线的OCR客户端。该客户端支持多种识别任务,包括文字、表格和公式,架构简单,服务端与客户端解耦,便于升级和维护。通过RestSharp实现HTTP请求,确保识别过程的安全与高效。

C# 结合 llama.cpp 实现 PaddleOCR-VL-1.5:本地 OCR 客户端开发全攻略

dotNET跨平台 dotNET跨平台 · 2026-05-12T00:01:01Z
Meta公司放弃开源Llama,转向专有的Muse Spark

Meta公司宣布其新AI模型Muse Spark将取代已被放弃的Llama。Muse Spark采用全新架构,无法与Llama迁移,Llama用户需寻找替代方案,开发者社区面临重大损失。

Meta公司放弃开源Llama,转向专有的Muse Spark

The New Stack The New Stack · 2026-04-30T15:05:45Z

本文探讨了开源许可证在非代码资产(如文档、数据和模型权重)中的应用,尤其是在大规模语言模型和生成式AI背景下。传统软件许可证(如MIT、Apache)已无法满足这些资产的需求。文章分析了Creative Commons、开放数据库许可证和OpenRAIL等不同类型的许可证,强调选择合适许可证的重要性,以确保合法合规并促进资源的有效使用。

【开源许可与版权工程】文档、数据、模型的许可:CC、ODbL、OpenRAIL、LLaMA 协议

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-04-22T00:00:00Z

本文探讨了2024-2025年开源模型许可证的多样性,强调模型权重的法律地位及其对工程决策的影响。不同许可证(如Apache 2.0、MIT、OpenRAIL-M等)在商用、再分发和修改方面的条款各异,工程团队需谨慎选择以避免法律风险。文章还分析了模型权重的著作权保护问题及不同司法区的倾向,并提供了具体的工程场景决策清单和合规建议。

【开源许可与版权工程】模型许可证深度解析:OpenRAIL-M、LLaMA、Apache 2.0 在大模型场景的真实区别

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-04-22T00:00:00Z
再见,Llama。

Meta推出的新一代大模型Muse Spark强调闭源策略,未提供开源链接,显示其开源立场的转变。与Llama系列相比,Muse Spark在性能上处于第一梯队,但未来的开源计划尚不明确,开发者面临不确定性。

再见,Llama。

dotNET跨平台 dotNET跨平台 · 2026-04-10T00:02:22Z
英特尔发布 OpenVINO 2026.1,新增 Llama.cpp 后端支持和硬件支持

英特尔发布了OpenVINO工具包的2026.1版本,新增对Qwen3 VL模型和GPT-OSS 120B的支持,优化了跨Intel CPU、GPU和NPU的推理,支持Wildcat Lake SoC和Intel Arc Pro B70显卡。

英特尔发布 OpenVINO 2026.1,新增 Llama.cpp 后端支持和硬件支持

实时互动网 实时互动网 · 2026-04-09T01:52:28Z
Runpod报告:Qwen已超越Meta的Llama,成为最常部署的自托管LLM

Runpod的AI报告显示,Qwen是最常部署的自托管LLM,而Llama 4几乎没有被采用。视频生成服务如Synthesia和Runway的应用表明,优化工作负载比单次生成更为重要。整体来看,AI基础设施的使用模式趋向于性能和效率的整合。

Runpod报告:Qwen已超越Meta的Llama,成为最常部署的自托管LLM

The New Stack The New Stack · 2026-03-12T13:00:57Z
在线教程丨免费CPU资源快速部署,覆盖Qwen3.5/DeepSeek-R1/Gemma 3/Llama 3.2等热门开源模型

开源模型迭代迅速,开发者希望低门槛部署新模型,但GPU成本和环境配置仍是障碍。HyperAI提供免费CPU配额和在线教程,帮助开发者快速体验模型。

在线教程丨免费CPU资源快速部署,覆盖Qwen3.5/DeepSeek-R1/Gemma 3/Llama 3.2等热门开源模型

HyperAI超神经 HyperAI超神经 · 2026-03-10T03:46:25Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码