小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ

本文介绍ABACUS第一性原理计算软件GPU版本的编译方法。文章对比平面波与数值原子轨道基组,指出GPU可加速电子步等耗时计算。详细说明使用conda配置CUDA 12.2环境、安装依赖库、编译ELPA及ABACUS的步骤,并通过BaTiO3示例验证GPU版本比CPU快1.60倍,且数值精度几乎一致。

编译 GPU 版本的 ABACUS

zhonger 前端开发者,喜爱运维管理 zhonger 前端开发者,喜爱运维管理 · 2026-09-07T07:14:00Z
Claude Fable 5.1 对比 Fable 5:在实际工作中,我无法区分它们。

Anthropic发布Claude Fable 5.1,宣称在编码和知识工作上有重大进步,基准测试得分翻倍。但作者用四个真实任务测试新旧模型,发现两者准确率均为满分,仅在速度和成本上略有差异。在复杂任务中,旧模型甚至更快更便宜。作者认为,对日常任务升级意义不大,改进可能仅体现在长时研究型任务上。

Claude Fable 5.1 对比 Fable 5:在实际工作中,我无法区分它们。

The New Stack The New Stack · 2026-09-05T15:00:00Z
GLM-5.3-Flash与GLM-5.3:时间与金钱的较量,而非规格表上的差异

GLM-5.3-Flash是Z.AI推出的低成本模型,价格约为旗舰版GLM-5.3的1/16。测试显示两者在编码、逻辑和提取任务中均得满分,准确性无差异,但Flash在困难任务中消耗更多token和时间,其成本优势依赖当前定价,可能变化。建议Flash适合简单任务,复杂任务需权衡时间与成本。

GLM-5.3-Flash与GLM-5.3:时间与金钱的较量,而非规格表上的差异

The New Stack The New Stack · 2026-09-01T18:51:56Z
匿名模型Ox Alpha现身:智谱GLM-5.3-Flash跑在10万张国产芯片上

智谱发布开源模型GLM-5.3-Flash,匿名测试版Ox Alpha性能宣称追平Claude Opus 4.8,价格仅四十分之一,并跑在10万张国产芯片上。但实际使用中性能参差,价格含促销折扣,芯片效率“相当”而非超越,API条款严苛。开发者评价分化,建议用户实测、算清成本、关注生态。

匿名模型Ox Alpha现身:智谱GLM-5.3-Flash跑在10万张国产芯片上

极道 极道 · 2026-08-26T22:01:00Z
TensorSharp 最新进展研究报告:从 DeepSeek V4 Flash 到 GLM-5.2,以及等待中的 GLM-5.3 - 张善友

TensorSharp 纯 .NET 推理引擎于8月19日支持GLM-5.2,在3×RTX PRO 6000上长prompt prefill比llama.cpp快约1.5倍,decode快4%。GLM-5.3同基座、后训练提升,预计8月28日开源,现有支持可无缝承接。此进展将前沿模型私有化部署降至工作站级别,.NET推理栈成可用选项。

TensorSharp 最新进展研究报告:从 DeepSeek V4 Flash 到 GLM-5.2,以及等待中的 GLM-5.3 - 张善友

张善友 张善友 · 2026-08-20T13:52:00Z
亚历山大·约菲:覆盖索引的代价是什么?

在2M行PostgreSQL 17上,覆盖索引比单列索引写入慢28%(INSERT)和25%(UPDATE),但读取快1.26倍。当写入低于每分钟约4300次时,覆盖索引更划算;否则单列索引更优。存储占用112MB对18MB。建议先设置random_page_cost=1.1,默认用单列索引,仅在需要时添加覆盖索引。

亚历山大·约菲:覆盖索引的代价是什么?

Planet PostgreSQL Planet PostgreSQL · 2026-08-17T00:00:00Z
AMD MI355X单节点跑Kimi K3达952t/s:每美元吞吐量暴打B300

AMD MI355X在运行Kimi K3模型时,凭借更低价格和更高每美元吞吐量,性能超越英伟达B300。通过修复投机解码和预填充内核的软件缺陷,MI355X单节点速度达到B200的3.8倍,首字延迟大幅降低。文章认为,CUDA生态并非不可撼动,硬件性价比和工程师修bug能力正成为新护城河。

AMD MI355X单节点跑Kimi K3达952t/s:每美元吞吐量暴打B300

极道 极道 · 2026-08-02T06:08:00Z
MTP 加速推理最佳实践:在亚马逊云科技中国区使用 llama.cpp 部署 Qwen3.6 的实测指南

本文在AWS中国区实测llama.cpp部署Qwen3.6模型,对比Graviton4、Intel CPU和A10G GPU的MTP加速效果。GPU上MTP提升83%性能,CPU上反而降低18-40%。最佳实践:GPU用27B Dense+MTP,CPU用35B MoE关闭MTP,后者成本仅为GPU的26%,性能达82%。

MTP 加速推理最佳实践:在亚马逊云科技中国区使用 llama.cpp 部署 Qwen3.6 的实测指南

亚马逊AWS官方博客 亚马逊AWS官方博客 · 2026-07-24T09:24:07Z
实测千问 Qwen3.8 预览版,国产模型开始围攻 Fable 5

国产大模型密集发布,Kimi K3与Qwen3.8-Max预览版相继亮相。实测Qwen3.8-Max在网页生成和3D游戏开发上速度飞快,但效果不稳定,复杂任务表现粗糙。国产开源模型数量已超美国,性能逼近闭源模型,差距缩小,未来竞争焦点或转向价格。

实测千问 Qwen3.8 预览版,国产模型开始围攻 Fable 5

爱范儿 爱范儿 · 2026-07-20T07:31:53Z

本文探讨了将O_DIRECT与io_uring组合使用的技术路径,旨在解决数据库和块存储引擎中的双重缓冲与系统调用开销问题。文章详细分析了组合使用的决策边界、O_DIRECT的对齐约束、io_uring固定缓冲区的注册方法及其与O_DIRECT叠加时的注意事项。通过实测对比了三种写路径的性能,指出register_buffers组合在特定环境下可能失败,强调需在目标内核上验证。最后提供了工程检查清单和选型建议,帮助读者在实际应用中做出正确决策。

【存储工程】O_DIRECT 与 io_uring:固定缓冲区、register_buffers 与工程选型

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-06-12T00:00:00Z
早期基准测试数据显示 英伟达RTX SPARK N1X芯片性能相当于苹果M3 MAX

英伟达RTX SPARK N1X芯片的早期基准测试显示,其性能与苹果M3 MAX相当。N1X拥有20个核心,而M3 MAX则为14个核心。尽管M3 MAX表现优异,N1X仍在优化中,未来可能提升性能。N1X的图形性能与RTX 5070相似,最终的Windows on Arm体验需待发布后评测。

早期基准测试数据显示 英伟达RTX SPARK N1X芯片性能相当于苹果M3 MAX

蓝点网 蓝点网 · 2026-06-02T08:00:21Z
2026 年国内外主流直播 SDK 的功能、价格和生态横向对比

直播 SDK 是直播平台的核心技术,选择不当可能导致高延迟和成本失控。文章对2026年主流直播 SDK 在性能、功能、价格和生态方面进行了横向对比,并推荐适合泛娱乐、在线教育和电商直播等不同场景的 SDK。建议在选择时进行实测,关注综合成本和技术支持。

2026 年国内外主流直播 SDK 的功能、价格和生态横向对比

实时互动网 实时互动网 · 2026-06-02T03:25:00Z

本文介绍了一个完整的LSM-Tree数据库引擎的实现,分为两个部分:第一部分使用C语言组装各个组件,提供六个API;第二部分用Rust重写核心模块,记录编译过程中的真实故事并进行性能对比。文章详细描述了数据库的内部结构、读写路径、崩溃恢复机制及后台线程的工作原理,强调了Rust在安全性方面的优势,并通过基准测试比较了C、Rust和LevelDB的性能,指出各自的优缺点。

【LSM-Tree】完整引擎 + Rust 重写对比

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-04-12T00:00:00Z
C++ vs .NET 数组原地反转实测:小数组 C++ 碾压,大数组 .NET 反杀?

在数组原地反转性能对比中,小数组时C++表现优异,而大数组时.NET的Array.Reverse反超。经过控制变量测试,结果显示C++在小规模时更快,.NET在大规模时更具优势,反映出两者在不同场景下的性能特点。

C++ vs .NET 数组原地反转实测:小数组 C++ 碾压,大数组 .NET 反杀?

dotNET跨平台 dotNET跨平台 · 2026-03-24T00:01:12Z

该系列文章通过五篇深入探讨如何从零构建LSM-Tree KV存储引擎,涵盖设计决策、组件功能及Rust重写,涉及WAL、MemTable、SSTable、Compaction等关键概念,最终提供完整引擎及性能对比。

从零写一个 LSM-Tree 存储引擎

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-03-15T00:00:00Z

在Go与Node.js的性能对比中,Go在冷启动和内存占用方面表现优异,内存使用量仅为Node.js的五分之一,且部署更简便;而Node.js在热启动时更具竞争力。选择编程语言时需平衡性能与工程需求。

性能之战的“罗生门”:Go 重写 Node.js 项目,究竟赢在了哪里?

Tony Bai Tony Bai · 2026-02-23T16:00:00Z
低延迟实时语音识别(ASR)模型部署实践与选型

本文探讨了低延迟实时语音识别(ASR)模型的部署与选型,分析了实时ASR的业务需求和技术平台选择。重点比较了Whisper Large-v3 Turbo、Voxtral Mini和NVIDIA Parakeet三种模型的性能,推荐在生产环境中结合NVIDIA推理GPU与SageMaker实时端点,以优化资源利用率和降低成本。

低延迟实时语音识别(ASR)模型部署实践与选型

亚马逊AWS官方博客 亚马逊AWS官方博客 · 2026-01-21T05:09:40Z
不服跑个分?.NET 10 大整数计算对阵 Java,结果令人意外

.NET的BigInteger与Java的BigInteger在高精度计算中的性能对比显示,两者在加法运算上相近,但在乘法和模幂运算中,.NET明显逊色于Java,尤其在密码学应用中表现不佳。建议对性能敏感的应用使用高性能库如GMP以提高计算效率。

不服跑个分?.NET 10 大整数计算对阵 Java,结果令人意外

dotNET跨平台 dotNET跨平台 · 2026-01-16T00:01:10Z
【Agentic AI for Data系列】Kiro实战:DuckDB vs Spark技术选型全流程

本文比较了DuckDB与Spark的技术选型,发现DuckDB在处理小文件时速度比Spark快90.4%。通过Agentic AI的Kiro助手,利用自然语言交互自动生成测试方案和代码,显著提高了选型效率,缩短了传统选型周期。

【Agentic AI for Data系列】Kiro实战:DuckDB vs Spark技术选型全流程

亚马逊AWS官方博客 亚马逊AWS官方博客 · 2025-10-31T06:02:47Z
信创CPU性能盘点

最新的计算机采购标准淘汰了老旧CPU,要求使用最新型号。性能对比显示,龙芯3A6000与英特尔I3 10100相当,而ARM阵营中的麒麟X90性能最佳。各CPU的测试环境不同,但结果差异不大。

信创CPU性能盘点

dotNET跨平台 dotNET跨平台 · 2025-10-04T00:00:55Z
  • <<
  • <
  • 1 (current)
  • 2
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码