Tensor Core 是专用的矩阵计算单元,利用 MMA 指令实现高效的矩阵乘加运算。FP16 Tensor Core 的吞吐量可达 72.8 TFLOP/s,显著高于 FP32 的 16 TFLOP/s。使用 Tensor Core 时,数据传输速度常成为瓶颈,因此需要优化数据布局和访存策略。CUDA 的 wmma API 简化了 Tensor Core 的使用,而高性能库如 CUTLASS 则能更精细地控制数据布局。
本文介绍了MLIR中的张量和线性代数方言,强调它们在AI编译中的重要性。张量方言表示不可变的多维数组,支持创建、读取和修改等核心操作。线性代数方言用于表达结构化数值计算,包含命名操作和通用操作,并支持分块、融合和向量化等优化策略。最终,Linalg操作需降阶为实际循环,以实现高效计算。
本文介绍了如何从零构建一个微型Tensor DSL,定义了一个包含四个操作的tiny方言,并实现了从tiny到linalg的降阶过程。项目结构包括方言定义、操作实现和降阶Pass,最终生成LLVM IR并通过JIT执行,展示了完整的编译链。
本文探讨了GPU在大模型训练中的优势,特别是与CPU的对比。GPU通过大量弱核和简化控制实现高算力密度,适合处理大规模矩阵运算。分析了GPU的执行模型、内存层级及Tensor Core的演进,强调带宽与算力平衡对性能的影响,并提出了优化策略以提高GPU在解码阶段的利用率。
Tensor Fusion是一种针对GPU集群的虚拟化和资源池解决方案,旨在提升集群利用率和降低推理延迟。它支持动态GPU池、低延迟推理、自动扩展和调度,适合高推理密度和多租户环境,有效处理多模型和多租户工作负载。
NVIDIA的Tensor Core专为加速矩阵运算而设计,TN布局在GEMM问题中表现最佳,优化了内存访问和缓存利用率,从而显著提升性能。大多数NVIDIA GPU架构仅支持TN布局的MMA指令。
Tensor公司宣称将首次大规模销售完全自动驾驶汽车,但面临技术和法律障碍。专家认为私人自动驾驶汽车不切实际,维护成本高且外观不佳。尽管市场对自动驾驶汽车持怀疑态度,汽车制造商仍在投资以保持竞争力。
NVIDIA GPU的峰值AI性能通常以TFLOPS或TOPS表示,但使用HPC软件重现这些性能并不总是有效。通过自定义微基准测试直接调用Tensor Core MMA指令,可以更可靠地测量性能。本文介绍了如何使用CUTLASS和CuTe测量NVIDIA Tensor Core MMA指令的峰值性能,并提供选择合适指令的参考。
在本期Google播客中,主持人Rachid Finge与Google硅团队的产品经理Jesse Seed讨论了Tensor G5芯片在Pixel 10和Pixel Fold中的应用,以及其对AI技术进步的推动作用。
Google 最近发布了 Pixel 10 系列,搭载台积电代工的 Tensor G5 芯片,采用 Imagination 的 PowerVR GPU 架构。PowerVR 自1992年起发展,曾与世嘉等公司合作,现正寻求在 Android 生态中实现多元化发展。
谷歌推出的Tensor G5芯片采用3nm工艺,提升了Pixel手机的性能,提供60%更强的TPU和34%更快的CPU,支持先进的设备内AI应用。新功能包括改进的摄像头、长达30小时的电池续航,增强用户体验。
Tensor公司宣布推出首款量产的L4级别个人自驾车,计划于2026年在美国、欧洲和中东上市。该车配备多种高科技传感器,旨在提升个人自由和隐私。
在将Pytorch模型转换为ONNX时,遇到“无法将需要梯度的Tensor作为常量”的错误。问题出在Conv2D层的权重设置为requires_grad为True。最终解决方案是将模型所有层的参数设置为requires_grad = False。
Triton 是一种基于 Python 的并行编程语言和编译器,旨在高效编写自定义 DNN 计算内核,并在现代 GPU 上运行。其核心数据结构为张量,支持多种操作和函数,简化编程过程。
本研究提出了TensorRL-QAS框架,结合张量网络与强化学习,解决量子架构搜索的可扩展性问题。该方法显著减少了CNOT门的使用和电路深度,提高了成功率,展示了在量子硬件上的高效性和鲁棒性。
本研究提出了一种新训练目标,通过对语义表示施加约束,增强正样本对齐。同时,针对BERT模型的注意力沉没现象,提出交叉注意力结构,以提升CLS标签的注意力和池化质量。该方法在多个语义文本相似度任务中表现优异。
本研究探讨将树张量网络嵌入量子神经网络,以解决多类图像分类问题。通过引入森林张量网络分类器,研究者成功应对高阶门操作和低成功率问题,证明该方法在提升预训练分类器性能方面的有效性,展示了TTN与QNN的协同作用为量子图像分类提供了稳健框架。
本研究通过结合预训练的欧几里得模型与超曲线交互项,解决了知识图谱补全中的几何表达不足问题,从而提高了链接预测的准确性和数据分布特性的捕捉能力。
本研究提出了TenAd方法,以解决深度学习视频分类模型在黑箱对抗攻击中的脆弱性。通过将视频表示为四阶张量,TenAd显著降低了搜索空间和查询次数,提高了攻击成功率和查询效率,生成几乎不可察觉的对抗扰动。
本研究提出了BitDecoding框架,解决了长上下文大语言模型在自回归解码中因KV缓存扩展带来的内存和计算挑战。该框架通过优化低位KV缓存的解码过程,显著减少去量化开销,实现了高达7.5倍的速度提升,展示了其在长上下文生成中的有效性。
完成下面两步后,将自动完成登录并继续当前操作。