小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
Dify.AI
AI Runtime上的快速、容错PyTorch训练

在大规模AI训练中,GPU利用率取决于“好吞吐”,即有效计算时间占比。数据加载和检查点机制是关键:频繁异步保存检查点(如每30分钟)可减少故障恢复成本,提升好吞吐至91%;数据管道需重叠预取和本地缓存,避免GPU空闲。同时,检查点需包含数据位置和随机数状态,确保恢复后训练正确。

AI Runtime上的快速、容错PyTorch训练

Databricks Databricks · 2026-08-28T01:15:00Z

PyTorch的`torch._assert_async` API可在GPU上异步执行断言,不阻塞CPU线程,避免图断裂。它接受布尔张量,失败时在流同步后报错。实现通过CUDA的`__trap`指令终止程序并污染上下文。建议仅用于开发,生产环境应移除,类似C++的`assert`在发布版中被优化掉。

PyTorch异步断言

Lei Mao's Log Book Lei Mao's Log Book · 2026-08-14T07:00:00Z
第746期:自由线程NumPy、__all__、PyTorch等(2026-08-04)

本文是Python周刊摘要,涵盖NumPy在自由线程CPython上的扩展、PEP 842模块导出、PyTorch深度学习教程、Django安全调试、子进程管理、SIMD纯Python实现、并发概念解析、CrewAI多智能体协作、Google Antigravity CLI使用及多个开源项目与近期Python活动预告。

第746期:自由线程NumPy、__all__、PyTorch等(2026-08-04)

PyCoder’s Weekly PyCoder’s Weekly · 2026-08-04T19:30:00Z

本文介绍如何在PyTorch多进程推理中通过CUDA IPC共享模型权重,避免GPU显存重复占用。示例展示了使用`model.share_memory()`共享权重,以及AOTInductor通过`load_constants`绑定父进程权重的方法。文中还讨论了配置要点、TorchScript的局限及程序依赖的重复问题,旨在提升单GPU多进程推理效率。

PyTorch多进程推理中的进程间权重共享

Lei Mao's Log Book Lei Mao's Log Book · 2026-07-31T07:00:00Z
PyTorch深度学习教程

本文介绍PyTorch深度学习框架,涵盖其特性、张量操作、环境搭建及构建MNIST手写数字识别模型的全流程。教程指导使用PyCharm配置环境、定义神经网络、训练并评估模型,最终达到96.87%测试准确率,并提及GPU加速、分布式训练等进阶技术。

PyTorch深度学习教程

The JetBrains Blog The JetBrains Blog · 2026-07-29T16:18:55Z
蚂蚁集团、阿里云等正式加入PyTorch基金会,携手全球开源力量推动AI普惠

2026年WAIC论坛聚焦AGI基础设施与普惠实践,专家共识认为AI竞争从模型转向系统,开源协作是关键,强调“够用正义”与成本效益,推动开放模型落地产业。蚂蚁发布具身智能模型LingBot-VA 2.0,实现“边行动边预测”。行业正从技术炫技转向务实落地,构建可负担、可持续的智能基础设施。

蚂蚁集团、阿里云等正式加入PyTorch基金会,携手全球开源力量推动AI普惠

量子位 量子位 · 2026-07-20T03:05:43Z
谷歌发布 TabFM-1.0.0-PyTorch:专为混合表格数据打造的零样本预测模型;跨越亚美欧!NVIDIA 开源多国合成人物数据集,千万级角色数据上线

TabFM 是 Google Research 发布的基础模型,专注于处理结构化表格数据,支持分类和回归任务。该模型通过上下文学习重塑表格预测,显著提升数据处理效率,并在零样本配置下超越多个传统基线模型。

谷歌发布 TabFM-1.0.0-PyTorch:专为混合表格数据打造的零样本预测模型;跨越亚美欧!NVIDIA 开源多国合成人物数据集,千万级角色数据上线

HyperAI超神经 HyperAI超神经 · 2026-07-17T10:18:20Z
PyTorch性能优化必知:内核与显存读写到底咋回事

本文讨论了PyTorch中GPU性能优化的关键概念,特别是内核与显存读写的关系。内核是GPU执行的程序,性能主要受数据在显存中读写次数的影响。通过操作融合可以减少显存流量,提高运行速度。此外,使用torch.compile工具可以自动优化代码,减少内核数量,提升性能。

PyTorch性能优化必知:内核与显存读写到底咋回事

极道 极道 · 2026-07-15T06:33:00Z
KubeCon + CloudNativeCon、OpenInfra Summit和PyTorch大会在中国联合,共同推动AI的规模化

2026年9月7日至9日,KubeCon + CloudNativeCon、OpenInfra Summit和PyTorch大会将在上海举行,聚焦云原生基础设施与人工智能的结合,推动生产级AI的标准化与应用。会议将探讨AI基础设施和平台工程等领域,促进开发者合作与创新。

KubeCon + CloudNativeCon、OpenInfra Summit和PyTorch大会在中国联合,共同推动AI的规模化

Cloud Native Computing Foundation Cloud Native Computing Foundation · 2026-06-18T20:31:13Z

本文讨论了PyTorch AOTInductor如何将具有混合设备执行计划的PyTorch导出程序编译成单个可执行包,该包可在CPU和GPU上运行模型,无需手动拆分模型。示例展示了如何使用AOTInductor编译和加载模型,并通过性能分析验证混合执行的有效性。

PyTorch AOTInductor 混合降级

Lei Mao's Log Book Lei Mao's Log Book · 2026-05-28T07:00:00Z

本文讨论了如何在PyTorch中使用Triton内核进行透明追踪和编译。用户可以通过@triton.jit创建Triton内核,并利用torch.compile和torch.export进行优化。注册的自定义操作可以在追踪和编译中被识别,而未注册的操作需使用TorchDynamo进行追踪。最终,Triton内核可通过AOTInductor进行预编译,以提升性能。

PyTorch Triton内核的透明追踪与编译

Lei Mao's Log Book Lei Mao's Log Book · 2026-05-22T07:00:00Z
你的显卡能跑多少算子?用 55 个检查项,给 PyTorch GPU 环境做一次冒烟测试 - 曦远Code

在Windows上使用RX 6650 XT运行自编译的ROCm和PyTorch时,LLM推理加速不明显,GPU利用率低。通过Python脚本检查PyTorch操作,发现54个操作返回CUDA/HIP张量,但性能未必高。常见问题包括MIOpen编译错误和显存不足,建议使用torch.profiler进行性能分析。

你的显卡能跑多少算子?用 55 个检查项,给 PyTorch GPU 环境做一次冒烟测试 - 曦远Code

程序设计实验室 程序设计实验室 · 2026-05-21T02:09:00Z

PyTorch的torch.export API可以生成深度学习模型的标准化表示,适用于无Python环境的部署。随着模型复杂性的增加,开发者需要验证大型模型是否能成功导出为GPU程序。为此,PyTorch提供了使用假张量构建假模型的方法,以验证导出兼容性。通过在FakeTensorMode中创建模型,开发者可以在不同设备上测试模型导出,确保无实际数据分配。

PyTorch假导出

Lei Mao's Log Book Lei Mao's Log Book · 2026-05-17T07:00:00Z

本文介绍了如何在PyTorch中实现自定义操作,包括使用C++和CUDA编写自定义函数和类。通过示例代码,展示了如何注册和使用这些自定义操作,确保它们在PyTorch模型和AOTInductor编译的推理程序中正常工作,并讨论了模型导出及推理验证。

PyTorch自定义操作

Lei Mao's Log Book Lei Mao's Log Book · 2026-05-10T07:00:00Z
ROCm on Windows 性能排查:RX 6650 XT 跑 PyTorch,为什么加速不明显? - 曦远Code

作者在Windows上使用RX 6650 XT显卡自编译ROCm和PyTorch进行深度学习。尽管torch.cuda.is_available()返回True,但GPU加速效果不佳,仅为1.7-2.0倍。主要原因包括自回归解码效率低、小模型在内存访问上的瓶颈,以及未启用高性能路径。建议进一步研究以优化性能。

ROCm on Windows 性能排查:RX 6650 XT 跑 PyTorch,为什么加速不明显? - 曦远Code

程序设计实验室 程序设计实验室 · 2026-05-09T05:41:00Z
PyTorch与TensorFlow:2026年选择合适的框架

选择PyTorch或TensorFlow时,关键在于项目需求。PyTorch适合研究和实验,因其动态计算图和直观的Python API,广泛用于自然语言处理和强化学习。TensorFlow在生产部署和企业环境中表现优越,提供成熟的工具和优化支持。选择应基于具体应用场景和团队背景。

PyTorch与TensorFlow:2026年选择合适的框架

The JetBrains Blog The JetBrains Blog · 2026-05-04T10:07:20Z

最近发布了用Rust编写的轻量级自动微分库ferris-grad。该库具有PyTorch风格的自动求导引擎,核心代码不到1000行,且无外部依赖。实现包括标量计算图、张量操作和神经网络层,支持训练多层感知机和mini GPT。项目灵感来源于Karpathy的micrograd和microgpt,欢迎参与贡献。

1000行Rust实现一个类似pytorch的轻量级自动微分库

Rust.cc Rust.cc · 2026-04-19T14:10:58Z

本文介绍了机器学习中自动微分的实现方法,通过将复杂函数拆解为基本运算构建计算图,以精确高效地计算导数。文章还展示了反向传播、梯度更新及优化器的实现,并提供了一个类似PyTorch的开源框架。

自動微分 | DIY 實現自己的 PyTorch

Louis Aeilot's Blog Louis Aeilot's Blog · 2026-04-12T23:45:09Z
PyTorch基金会通过Safetensors、ExecuTorch和Helion扩展AI生态系统

在巴黎的PyTorch大会上,PyTorch基金会宣布了三个新项目:Safetensors、ExecuTorch和Helion,旨在增强开源AI的安全性和效率。Safetensors提供安全的模型分发,ExecuTorch简化边缘设备上的模型运行,Helion则简化机器学习内核的开发。这标志着PyTorch在开源AI领域的进一步发展。

PyTorch基金会通过Safetensors、ExecuTorch和Helion扩展AI生态系统

The New Stack The New Stack · 2026-04-09T19:18:44Z
CNCF与PyTorch社区齐聚KubeCon + CloudNativeCon中国2026:征集提案现已开放

2026年9月8日至9日,上海将举办KubeCon + CloudNativeCon + OpenInfra Summit Asia + PyTorch Conference China,汇聚云原生、开放基础设施和AI社区。活动欢迎开发者和企业领导分享经验,讨论技术挑战。提案征集已开放,截止日期为2026年5月3日,注册也已开始,提供多种通行证类型。

CNCF与PyTorch社区齐聚KubeCon + CloudNativeCon中国2026:征集提案现已开放

Cloud Native Computing Foundation Cloud Native Computing Foundation · 2026-04-09T14:19:42Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码