小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
【Triton 教程】triton_language.floor

Triton是一种基于Python的并行编程语言和编译器,用于高效编写自定义DNN计算内核,并在现代GPU上实现最大吞吐量。文章还介绍了其函数triton.language.floor,用于逐元素向下取整,参数为Block类型的输入值。

【Triton 教程】triton_language.floor

HyperAI超神经 HyperAI超神经 · 2026-08-31T11:03:06Z
【Triton 教程】triton_language.fdiv

Triton是一种基于Python的并行编程语言和编译器,用于高效编写自定义DNN计算内核,并在现代GPU上实现最大吞吐量。文章还介绍了其在线教程及函数triton.language.fdiv(x,y),用于计算x和y的逐元素快速除法。

【Triton 教程】triton_language.fdiv

HyperAI超神经 HyperAI超神经 · 2026-08-22T09:38:16Z
毕昇编译器核心AscendNPU IR开源,华为架构师海丽娟详解技术进展,支持Triton等算子生态

华为AscendNPU IR编译器架构师海丽娟在技术沙龙中介绍了其开源底座,该底座基于MLIR构建,提供Tile级抽象,支持多语言接入昇腾硬件,适配A2/A3至昇腾950架构,优化CV流水并行、寄存器融合、SIMT支持及多核切分,提升算子开发效率。项目已开源,社区提供任务和免费算力。

毕昇编译器核心AscendNPU IR开源,华为架构师海丽娟详解技术进展,支持Triton等算子生态

HyperAI超神经 HyperAI超神经 · 2026-08-18T09:13:09Z
Kimi K3配Prime Agent查CUDA内核:发现人写的跑不过机器自动的

AI智能体Prime Agent发现手写CUDA内核在RTX 3090上性能比Triton自动生成代码慢15%,调整分块尺寸无效,瓶颈不在共享内存。AI辅助编程正从“写代码”进化到“发现人类想不到的优化方向”,人类仍负责最终修复。

Kimi K3配Prime Agent查CUDA内核:发现人写的跑不过机器自动的

极道 极道 · 2026-08-08T10:42:00Z
智源研究院提出 Triton-TLE 分层语言扩展,并通过 FlagTree 编译优化实现百倍级自动调优加速

8月1日北京举办AI编译器技术沙龙,BAAI团队介绍FlagTree项目,通过Triton语言扩展TLE(分Lite、Struct、Raw三层)平衡抽象与性能,覆盖算子优化、架构调优及原生代码。编译优化包括TileIR后端、自动调优(FlagOSTune加速120倍)、数据布局转换消除及指令重排,显著提升DeepSeek等模型性能,未来聚焦NUMA和MegaKernel。

智源研究院提出 Triton-TLE 分层语言扩展,并通过 FlagTree 编译优化实现百倍级自动调优加速

HyperAI超神经 HyperAI超神经 · 2026-08-08T09:27:09Z

Triton是一种基于Python的并行编程语言和编译器,用于高效编写自定义DNN计算内核,并在现代GPU上实现最大吞吐量。文章还提供了在线教程链接及triton.language.exp2函数的说明,该函数用于计算逐元素以2为底的指数。

【Triton 教程】triton_language.exp2

HyperAI超神经 HyperAI超神经 · 2026-08-07T07:19:50Z
倒计时一天!智源/TileRT/腾讯/华为/智元创新多方集结,共探 AI 编译的多层级协同优化

8月1日北京将举办AI编译器技术分享会,智源、TileRT、腾讯、华为昇腾、智元创新等专家出席。议题涵盖Triton语言扩展、TileRT低延迟推理、FalconGEMM低复杂度矩阵乘法、AscendNPU IR开源及具身智能编译器,探讨多层级协同优化。活动限150人,需报名。

倒计时一天!智源/TileRT/腾讯/华为/智元创新多方集结,共探 AI 编译的多层级协同优化

HyperAI超神经 HyperAI超神经 · 2026-07-31T09:16:06Z

Triton是一种基于Python的并行编程语言和编译器,用于高效编写自定义DNN计算内核,并能在现代GPU上以最大吞吐量运行。其triton.language.exp(x)函数可计算输入块x的逐元素指数值。

【Triton 教程】triton_language.exp

HyperAI超神经 HyperAI超神经 · 2026-07-29T03:50:25Z

Netflix has described the production lessons behind bringing LLM inference into its internal serving platform, including the challenges of supporting different model sizes, hardware requirements,...

Netflix Details its In-House LLM Serving Platform with Triton and vLLM

InfoQ InfoQ · 2026-07-27T07:33:00Z
UTM团队推出DX11驱动程序 可在QEMU虚拟机中获得比较完整的DX11支持

UTM推出新驱动Triton,为QEMU虚拟机提供更完整的DX11支持,改进Windows图形加速。Triton将DDI调用转为DX11,配合Neptune转发,减少转换层,提升兼容性。但macOS上因苹果授权限制,暂无法打包D3DMetal。代码已开源,仍处实验阶段,普通用户可等待后续版本。

UTM团队推出DX11驱动程序 可在QEMU虚拟机中获得比较完整的DX11支持

蓝点网 蓝点网 · 2026-07-26T08:59:31Z

Triton 是一种新型编程模型,简化了深度学习算子的开发。它通过编译器自动处理访存合并、共享内存管理和指令调度,减少了手动编码的复杂性。Triton 采用 tile 视角,允许开发者专注于数据块的处理,配合 autotune 功能自动优化配置,提升性能。总体而言,Triton 提高了开发效率,适合大多数自定义算子,但在极限性能和特定场景下仍需使用 CUDA。

【GPU 算子工程】Triton:tile 级编程模型与 autotune

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-06-28T00:00:00Z

本文讨论了如何在PyTorch中使用Triton内核进行透明追踪和编译。用户可以通过@triton.jit创建Triton内核,并利用torch.compile和torch.export进行优化。注册的自定义操作可以在追踪和编译中被识别,而未注册的操作需使用TorchDynamo进行追踪。最终,Triton内核可通过AOTInductor进行预编译,以提升性能。

PyTorch Triton内核的透明追踪与编译

Lei Mao's Log Book Lei Mao's Log Book · 2026-05-22T07:00:00Z

本文探讨了NVIDIA的CUDA生态系统,包括编译链、高层工具、分层结构、数学库(如cuBLAS和cuDNN)、通信库(如NCCL)及Triton DSL。文章比较了AMD ROCm和华为CANN的定位,分析了CUDA在大模型训练中的重要性和优势,并强调了性能调优工具Nsight的使用,以及FP8训练的潜在问题和解决方案。

【大模型基础设施工程】03:CUDA 生态——cuBLAS、cuDNN、NCCL、Triton、CUTLASS

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-04-22T00:00:00Z

Triton是一种基于Python的并行编程语言和编译器,旨在高效编写自定义深度神经网络计算内核,并在现代GPU上运行。它提供了多种处理张量的函数,如argmax、argmin、max、min、reduce和sum。

【Triton 教程】triton-ops

HyperAI超神经 HyperAI超神经 · 2026-04-07T02:49:03Z

加载模型时出现错误,提示'importlib_metadata'模块缺少'EntryPoints'属性,导致无法执行。

【Triton 教程】math-ops

HyperAI超神经 HyperAI超神经 · 2026-04-01T10:37:20Z

本报告探讨OpenClaw体系下Agent的强化学习训练方法,重点分析RFT与GRPO的训练流程,旨在降低强化学习训练门槛,实现训练自动化,并提升Agent的任务性能。

【Triton 教程】triton_language.erf

HyperAI超神经 HyperAI超神经 · 2026-03-24T06:36:07Z

本次作业通过基准测试和性能分析不同规模的模型,研究规模对性能的影响,并建议使用代码自动生成表格以简化报告格式化。

【Triton 教程】triton_language.div_rn

HyperAI超神经 HyperAI超神经 · 2026-03-18T08:58:29Z

命令执行失败,状态码为127,可能是由于缺少依赖或配置错误造成的。

【Triton 教程】triton_language.cos

HyperAI超神经 HyperAI超神经 · 2026-03-09T01:56:08Z
vLLM Triton 注意力后端深度解析

本文介绍了IBM研究、红帽和AMD团队开发的vLLM Triton注意力后端,旨在实现跨GPU平台的高性能。Triton是一种特定领域语言,支持用Python编写高效的GPU内核,兼容多种模型和硬件。通过优化内核设计和微基准测试,Triton后端在AMD、NVIDIA和Intel平台上表现优异,成为默认的注意力后端。

vLLM Triton 注意力后端深度解析

vLLM Blog vLLM Blog · 2026-03-04T00:00:00Z

本文解读了IEEE生物医学与健康信息学期刊中关于运动想象EEG解码的研究MSVTNet,该方法结合多尺度卷积与Vision Transformer,构建CNN-Transformer混合模型,以提升训练稳定性。文章梳理了模型背景、核心结构及实验结果,并讨论了其优势与改进方向。

【Triton 教程】triton_language.clamp

HyperAI超神经 HyperAI超神经 · 2026-03-02T05:28:42Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码