MIT团队开发了名为PottsMPNN的机器学习框架,用于改进计算蛋白质设计。该框架结合物理原理,能更准确建模序列-能量关系,生成结构可行但序列新颖的蛋白质,避免过度模仿天然序列。研究强调,传统以复现天然序列为成功标准并不最佳,PottsMPNN通过引入成对氨基酸相互作用和进化信息,提升了结构兼容性和突变稳定性预测,为设计新型蛋白质奠定基础。
TVM 0.21.0 发布,中文文档同步更新。文章介绍 Relax 抽象,用于端到端优化机器学习模型,以两层神经网络为例,展示高层 Numpy 与 Relax 代码,及底层实现。关键元素包括结构信息、R.call_tir 调用底层函数、数据流块标记纯函数区域,便于编译器优化如算子融合。
论文复现是科学基石,但机器学习领域面临可复现性危机。Inherent Labs团队训练了270亿参数的AI智能体Faraday,利用Codex GPT-5.5作为工具,在73%的分布内任务和60%的AI for Science任务上超越Claude和GPT-5.5。Faraday通过自动生成任务空间和稳定GRPO后训练,展现出更强的科学严谨性,能指导更大模型工作,提升复现能力。
MIT工程师开发了一种新算法,能生成前所未有的极端事件和最坏情景,无需依赖历史极端事件数据。该算法通过机器学习结合点统计和空间地图,可预测如百年一遇风暴的规模、强度和影响范围,适用于天气、电网、金融等领域,帮助规划者评估风险并加强基础设施韧性。
本文介绍如何将经典机器学习管道与智能体AI结合,构建混合客户流失预测与自动保留系统。使用scikit-learn训练随机森林分类器预测流失风险,再通过Groq的Llama 3.3模型驱动智能体,根据预测结果自主决策执行折扣或人工回访等操作,实现从被动预测到主动决策的转变。
本文通过图解方式厘清AI、机器学习、深度学习和生成式AI的关系。AI是总目标,机器学习通过数据学习,深度学习利用神经网络自动提取特征,生成式AI基于大模型创作内容。文章还简述了技术发展时间线,强调AI是工具,关键在于理解和使用。
MIT研究人员开发了一种计算方法,利用机器学习预测哪些过渡金属氮化物合金能更高效地催化电化学氨生产,替代依赖化石燃料的哈伯-博世工艺。该方法识别关键物理特性,加速寻找低排放催化剂,有望降低能耗和碳排放,但尚需实验验证。
TVM 0.21.0 发布,中文文档同步更新。文章阐述图抽象在机器学习编译器中的关键作用,通过有向图表示模型结构和数据流,便于优化。重点介绍 Relax IR 的特性:符号形状追踪动态维度、多层次抽象支持跨层优化、可组合变换实现灵活定制,共同提升 TVM 对模型的端到端优化能力。
本文介绍机器学习中潜在空间(latent space)的三种核心作用:描述性(如PCA压缩高维数据)、生成性(通过插值创造新数据点)和预测性(如推荐系统、RAG中计算相似度)。潜在空间将复杂数据转化为结构化数值表示,是压缩、生成和连接数据的关键基础概念。
本文探讨机器学习中的数据遗忘问题。作者提出,传统遗忘方法对所有数据点一视同仁,但某些数据点对模型影响微乎其微。通过分析语言和视觉任务中的影响函数,他们识别出这些低影响数据,并据此提出高效遗忘框架,在遗忘前缩减数据集规模,从而在真实案例中节省约50%的计算成本。
WhatsApp推出可选功能“Scam Alert”,通过设备端机器学习模型检测可疑诈骗消息,不泄露内容,保护端到端加密。模型下载经透明账本验证,防止定向投放。用户可控制开关,误报可标记信任。隐私分析采用机密联邦计算和差分隐私,仅收集匿名聚合数据。该功能已开始Beta测试,并邀请安全社区参与验证。
Vulkan 1.4.359发布,新增VK_EXT_cooperative_matrix_maintenance1扩展,增强协作矩阵功能,支持类型转换、归约及逐元素操作,加速机器学习推理等任务。该扩展由NVIDIA、高通、英特尔和Arm工程师共同开发,并提供新查询命令以优化属性。
Jeff Dean创办的AI公司Discovery Loop以极简三页PPT融资,展示创始人成就、团队规模及学术影响力,吸引硅谷VC排队投资。公司旨在自动化机器学习与科学实验循环,初期聚焦ML研究,未来扩展至硬件和药物发现。已获Khosla Ventures等领投数亿美元,Alphabet参与投资并签署云计算合作。
思科IT利用AI和机器学习,结合Splunk平台整合全球语音数据,构建综合风险评分引擎,实现主动防御。该系统将通话欺诈减少70%,人工调查工作量降低60%,提升运营效率和安全性,重塑企业语音信任。
该研究利用机器学习方法,基于P波到达后4秒内的应变波形特征,快速判断地震是否达到M5.4预警阈值。模型在钻孔应变仪数据上训练,并在DAS光缆数据中验证,成功识别2024年门多西诺角M7.0地震。该方法绕开传统震中定位,为近海地震预警提供新路径,有望补充传统台网监测不足。
本文介绍构建和部署自主AI智能体的七个步骤,强调从原型过渡到生产系统需注重编排与部署实践。关键在于预先设定明确边界和护栏,确保智能体在约束内运行。使用LangGraph等框架提供有状态检查点,以构建可靠的多步骤推理循环,实现规模化应用。
本文介绍数据科学家应掌握的七种核心机器学习算法:线性回归、逻辑回归、LightGBM、XGBoost、随机森林、LSTM和K-means聚类,并附Python代码示例。作者强调,简单模型往往比LLM更高效、低成本,选择适合问题的模型比追求最新技术更重要。
NBCUniversal与Databricks及EXL合作,迁移至统一数据智能平台,采用job-specific计算和Delta Lake架构,实现数据基础设施现代化。此举降低30%成本,支持300名分析师,提升弹性扩展和ML能力,加速决策,增强竞争优势。
AI客服通过自然语言处理、机器学习和预测分析自动处理常规咨询,提升效率并降低成本。AI代理能自主完成多步骤任务,人类代理则专注于复杂敏感问题。部署应从试点开始,注重数据质量和人机协作。情感分析可预测客户流失,个性化服务能增加收入。预计到2030年,60%的客服互动将由AI管理。
GoMLX是Go语言的机器学习框架,两年间从雏形发展为1.5k星标项目,核心计算引擎拆分为独立compute仓库。它提供Backend、Graph、Tensor、Store四大抽象,支持xla、纯Go和go-darwinml三种后端,可训练模型并对接HuggingFace和ONNX生态。虽生态不及Python,但适合Go服务集成,正迈向生产可用。
完成下面两步后,将自动完成登录并继续当前操作。