Google的TPU是其专为深度学习设计的定制AI芯片,不同于为图形而生的GPU。最新第八代分为两款:TPU 8t用于训练,侧重高吞吐量;TPU 8i用于推理,侧重低延迟和芯片间速度。两者共享Axion CPU、液冷和软件栈,代码可互用。
黄仁勋在访谈中回顾英伟达创业历程:早期技术方向错误,靠自学OpenGL扭转局面;与世嘉合作失败后获500万美元续命。他分享了对深度学习、AI智能体、物理AI和自动驾驶的洞察,强调系统思维、开源生态和持续学习的重要性,并鼓励年轻人勇敢创业。
该文章介绍香港大学Taku Komura教授团队在动作生成领域的研究。其2016年论文获SIGGRAPH时间检验奖,首次用深度学习学习人类运动先验,生成自然动作。团队后续扩展至场景交互,开源项目AI4Animation获8000+星。研究正应用于物理AI,用消费级设备低成本采集人类操作数据,训练世界模型,推动具身智能走向真实生活。
本文介绍PyTorch深度学习框架,涵盖其特性、张量操作、环境搭建及构建MNIST手写数字识别模型的全流程。教程指导使用PyCharm配置环境、定义神经网络、训练并评估模型,最终达到96.87%测试准确率,并提及GPU加速、分布式训练等进阶技术。
深度学习是机器学习的一个子集,利用多层神经网络模拟人脑结构。主要类型包括卷积神经网络(CNN)、递归神经网络(RNN)和变换器(Transformers)。Keras是一个用户友好的深度学习API,简化模型构建和训练过程。
文章探讨了AI基础设施中的向量、神经网络和深度学习的核心概念。向量将词语转化为数字以计算相似度,点积运算用于衡量向量对齐程度。神经网络通过多层结构重塑输入,激活函数影响学习效果,损失函数定义错误,训练通过梯度下降优化模型参数。文章指出当前模型在处理上下文时的局限性,强调Transformer架构的重要性。
SkillOpt 是一款优化工具,旨在提升技能文档质量。它通过模拟深度学习训练过程,记录 Agent 执行技能的情况,分析成功与失败的模式,并提出针对性的修改方案。经过验证后,只有有效的修改才会被接受。该工具已开源,适用于 Markdown 格式的技能文档,能够提高 Agent 的执行能力。
本期GitHub热门项目周刊精选了10个开源项目,涵盖AI、开发工具和云原生等领域,主要项目包括Codex-orange-book文档库、DeepSpec深度学习工具和Exploitarium漏洞利用库,适合开发者快速了解新工具和趋势。
GEMM(通用矩阵乘)是深度学习中的关键计算。通过优化实现,从朴素实现到共享内存和寄存器分块,显著提高了算术强度。寄存器分块的性能达到6375 GFLOP/s,接近FP32峰值的39%。未来的优化方向包括向量化、预取和更大的tile设计。
Triton 是一种新型编程模型,简化了深度学习算子的开发。它通过编译器自动处理访存合并、共享内存管理和指令调度,减少了手动编码的复杂性。Triton 采用 tile 视角,允许开发者专注于数据块的处理,配合 autotune 功能自动优化配置,提升性能。总体而言,Triton 提高了开发效率,适合大多数自定义算子,但在极限性能和特定场景下仍需使用 CUDA。
Databricks利用深度学习和计算机视觉技术,简化视频数据分析流程。用户可通过自然语言查询上传视频,系统自动处理并提取相关片段,生成文本摘要。该无服务器的GPU计算架构支持大规模视频处理,适用于基础设施检查和安全监控等领域。
本文探讨了深度学习算子在GPU上的性能优化,重点关注算子实现、内存管理和调优方法。介绍了Roofline模型和FlashAttention等技术,分析了访存瓶颈及其优化策略,旨在为工程师提供系统的学习路径,帮助理解算子性能与调优。
深度学习中的缩放法则表明,训练损失随着模型规模、数据集规模和计算量的增加而降低,遵循幂律关系。这一规律有助于优化计算资源在模型和数据之间的分配。研究显示,模型大小与数据量的最佳比例对性能提升至关重要。Kaplan和Chinchilla的研究结果存在分歧,前者建议模型增长速度应快于数据,后者则认为两者应同步增长。
近年来,机器学习在材料科学中的应用逐渐深入,特别是在高维光谱数据的预测与解析方面。日本东京科学研究所的研究团队提出了一种新方法,利用深度学习模型ALIGNN处理光吸收光谱数据,显著提高了预测精度。研究构建了包含2681种材料的数据库,并通过特征提取与聚类分析,成功识别出影响光谱特征的关键元素及其配位环境,为材料设计提供了新的思路和工具。
这篇文章讨论了塞巴斯蒂安·马拉比对人工智能发展的看法,特别是深度学习和超智能的探索。他的新书《无限机器》讲述了德米斯·哈萨比斯及其团队在人工智能领域的突破,如AlphaGo和AlphaFold。马拉比强调,尽管人工智能潜力巨大,但在实现过程中面临许多挑战和不确定性。他认为,理解复杂主题需要深入研究和与专家交流,并提到与中国在AI安全方面的对话潜力。
在2026年数据与AI峰会上,Databricks推出了新功能Genie Code,提升机器学习模型的开发和部署效率,自动化特征工程和模型训练,缩短实验到生产的时间。同时,AI Runtime支持高性能多节点训练,简化GPU基础设施管理。Databricks的模型服务能力帮助客户降低基础设施成本,提高延迟性能,支持高并发请求,广泛应用于实时机器学习系统。
文章讨论了作者对人工智能(AI)模型的看法,特别是深度学习和语言模型的演变。作者认为AI在提升生产力方面具有潜力,但也对其对人类福祉的影响表示担忧。尽管存在疑虑,作者对AI的未来持乐观态度,期待人类能找到解决潜在问题的方法。
近年来,人工智能正在向物理世界迁移。赛豆科技推出的AIVA品牌强调AI在汽车设计中的重要性,改变了传统的汽车制造模式。AIVA通过深度学习用户需求,提升驾驶的舒适性与安全性。首款量产车型AIVA ME7将于今年发布,标志着智能汽车行业的新变革。
AI工程师的角色与传统数据科学分离,需掌握深度学习框架、模块化管道设计及安全部署模型等技能。文章探讨五个关键Python概念,包括张量与自动求导、__call__方法、序列化、抽象基类及环境变量管理,强调这些知识在构建生产级AI系统时的重要性,有助于提升系统的可扩展性、安全性和稳健性。
文章讨论了延迟、吞吐量和带宽的区别。延迟是数据包从发送者到接收者的时间,吞吐量是每秒成功传输的数据量,而带宽是连接的最大容量。低延迟不一定意味着高吞吐量,三者各自解决不同的问题。此外,文章介绍了谷歌的TPU芯片,专为深度学习设计,具有不同的训练和推理模式。
完成下面两步后,将自动完成登录并继续当前操作。