在大规模AI训练中,GPU利用率取决于“好吞吐”,即有效计算时间占比。数据加载和检查点机制是关键:频繁异步保存检查点(如每30分钟)可减少故障恢复成本,提升好吞吐至91%;数据管道需重叠预取和本地缓存,避免GPU空闲。同时,检查点需包含数据位置和随机数状态,确保恢复后训练正确。
PyTorch的`torch._assert_async` API可在GPU上异步执行断言,不阻塞CPU线程,避免图断裂。它接受布尔张量,失败时在流同步后报错。实现通过CUDA的`__trap`指令终止程序并污染上下文。建议仅用于开发,生产环境应移除,类似C++的`assert`在发布版中被优化掉。
本文是Python周刊摘要,涵盖NumPy在自由线程CPython上的扩展、PEP 842模块导出、PyTorch深度学习教程、Django安全调试、子进程管理、SIMD纯Python实现、并发概念解析、CrewAI多智能体协作、Google Antigravity CLI使用及多个开源项目与近期Python活动预告。
本文介绍如何在PyTorch多进程推理中通过CUDA IPC共享模型权重,避免GPU显存重复占用。示例展示了使用`model.share_memory()`共享权重,以及AOTInductor通过`load_constants`绑定父进程权重的方法。文中还讨论了配置要点、TorchScript的局限及程序依赖的重复问题,旨在提升单GPU多进程推理效率。
本文介绍PyTorch深度学习框架,涵盖其特性、张量操作、环境搭建及构建MNIST手写数字识别模型的全流程。教程指导使用PyCharm配置环境、定义神经网络、训练并评估模型,最终达到96.87%测试准确率,并提及GPU加速、分布式训练等进阶技术。
2026年WAIC论坛聚焦AGI基础设施与普惠实践,专家共识认为AI竞争从模型转向系统,开源协作是关键,强调“够用正义”与成本效益,推动开放模型落地产业。蚂蚁发布具身智能模型LingBot-VA 2.0,实现“边行动边预测”。行业正从技术炫技转向务实落地,构建可负担、可持续的智能基础设施。
TabFM 是 Google Research 发布的基础模型,专注于处理结构化表格数据,支持分类和回归任务。该模型通过上下文学习重塑表格预测,显著提升数据处理效率,并在零样本配置下超越多个传统基线模型。
本文讨论了PyTorch中GPU性能优化的关键概念,特别是内核与显存读写的关系。内核是GPU执行的程序,性能主要受数据在显存中读写次数的影响。通过操作融合可以减少显存流量,提高运行速度。此外,使用torch.compile工具可以自动优化代码,减少内核数量,提升性能。
2026年9月7日至9日,KubeCon + CloudNativeCon、OpenInfra Summit和PyTorch大会将在上海举行,聚焦云原生基础设施与人工智能的结合,推动生产级AI的标准化与应用。会议将探讨AI基础设施和平台工程等领域,促进开发者合作与创新。
本文讨论了PyTorch AOTInductor如何将具有混合设备执行计划的PyTorch导出程序编译成单个可执行包,该包可在CPU和GPU上运行模型,无需手动拆分模型。示例展示了如何使用AOTInductor编译和加载模型,并通过性能分析验证混合执行的有效性。
本文讨论了如何在PyTorch中使用Triton内核进行透明追踪和编译。用户可以通过@triton.jit创建Triton内核,并利用torch.compile和torch.export进行优化。注册的自定义操作可以在追踪和编译中被识别,而未注册的操作需使用TorchDynamo进行追踪。最终,Triton内核可通过AOTInductor进行预编译,以提升性能。
在Windows上使用RX 6650 XT运行自编译的ROCm和PyTorch时,LLM推理加速不明显,GPU利用率低。通过Python脚本检查PyTorch操作,发现54个操作返回CUDA/HIP张量,但性能未必高。常见问题包括MIOpen编译错误和显存不足,建议使用torch.profiler进行性能分析。
PyTorch的torch.export API可以生成深度学习模型的标准化表示,适用于无Python环境的部署。随着模型复杂性的增加,开发者需要验证大型模型是否能成功导出为GPU程序。为此,PyTorch提供了使用假张量构建假模型的方法,以验证导出兼容性。通过在FakeTensorMode中创建模型,开发者可以在不同设备上测试模型导出,确保无实际数据分配。
本文介绍了如何在PyTorch中实现自定义操作,包括使用C++和CUDA编写自定义函数和类。通过示例代码,展示了如何注册和使用这些自定义操作,确保它们在PyTorch模型和AOTInductor编译的推理程序中正常工作,并讨论了模型导出及推理验证。
作者在Windows上使用RX 6650 XT显卡自编译ROCm和PyTorch进行深度学习。尽管torch.cuda.is_available()返回True,但GPU加速效果不佳,仅为1.7-2.0倍。主要原因包括自回归解码效率低、小模型在内存访问上的瓶颈,以及未启用高性能路径。建议进一步研究以优化性能。
选择PyTorch或TensorFlow时,关键在于项目需求。PyTorch适合研究和实验,因其动态计算图和直观的Python API,广泛用于自然语言处理和强化学习。TensorFlow在生产部署和企业环境中表现优越,提供成熟的工具和优化支持。选择应基于具体应用场景和团队背景。
最近发布了用Rust编写的轻量级自动微分库ferris-grad。该库具有PyTorch风格的自动求导引擎,核心代码不到1000行,且无外部依赖。实现包括标量计算图、张量操作和神经网络层,支持训练多层感知机和mini GPT。项目灵感来源于Karpathy的micrograd和microgpt,欢迎参与贡献。
本文介绍了机器学习中自动微分的实现方法,通过将复杂函数拆解为基本运算构建计算图,以精确高效地计算导数。文章还展示了反向传播、梯度更新及优化器的实现,并提供了一个类似PyTorch的开源框架。
在巴黎的PyTorch大会上,PyTorch基金会宣布了三个新项目:Safetensors、ExecuTorch和Helion,旨在增强开源AI的安全性和效率。Safetensors提供安全的模型分发,ExecuTorch简化边缘设备上的模型运行,Helion则简化机器学习内核的开发。这标志着PyTorch在开源AI领域的进一步发展。
2026年9月8日至9日,上海将举办KubeCon + CloudNativeCon + OpenInfra Summit Asia + PyTorch Conference China,汇聚云原生、开放基础设施和AI社区。活动欢迎开发者和企业领导分享经验,讨论技术挑战。提案征集已开放,截止日期为2026年5月3日,注册也已开始,提供多种通行证类型。
完成下面两步后,将自动完成登录并继续当前操作。