翁荔因长期健康问题宣布离开Thinking Machines Lab,无法承受联合创始人的压力。她曾组建OpenAI安全团队,后与Mira Murati共同创业,公司刚发布开源模型Inkling。离职信中多次致歉,强调健康优先。公司面临估值回落、核心人才流失等挑战,但翁荔选择暂停,认为承认身体极限同样需要勇气。
超维动力与北大医疗合作,推动具身智能在医疗场景落地。合作聚焦数据采集、世界模型与仿真训练,构建“拟真训练—场景验证—医院应用”路径。通过高拟真医院、数据头环和数字资产库,解决训练环境与数据瓶颈,优先验证试管分拣、药品配送等任务,确保安全应用。
菲尔兹奖首次授予中国籍数学家,王虹与邓煜双双获奖,创造历史。王虹证明三维挂谷猜想,邓煜解决希尔伯特第六问相关难题。两人均出自北大,经历各异,但都凭纯粹热爱与坚持取得突破,激励后学。
本文记录了作者作为独立开发者的生活,包括骑车锻炼、税务申报、微信支付退款问题及送外卖的经历,强调面对困难的重要性,并分享了工作与生活中的挑战与解决方法。
AI Agent 正在从对话工具转变为任务执行者,广泛应用于自动化办公和代码生成等领域。与传统大语言模型不同,Agent 能够拆解任务并自主推进。为支持其能力,相关数据集强调过程能力,包括长程规划和多步推理。本文整理了10个关键数据集,涵盖长上下文理解、任务规划和工具调用等能力,推动 AI Agent 的研究与应用。
李斌在北大毕业30周年演讲中分享了自己创业30年的经历,特别提到经历的三次低谷:首次创业时合伙人离开、易车的战略调整,以及蔚来的市场挑战。他强调在困境中要诚实面对自己,向内求索,最终实现蔚来的反弹与盈利,并鼓励年轻人忠于内心,勇敢前行。
英伟达CEO黄仁勋认可华为的“韬定律”,称其为技术突破,但认为不会威胁台积电。他将华为的逻辑折叠与台积电的3D封装混淆,实际上两者在技术上有本质区别。华为的逻辑折叠通过三维折叠重构电路,显著提升性能,而台积电的技术则是优化物理堆叠。此评价被认为存在偏颇。
VGGT-Edit是一种新型3D编辑框架,旨在直接在3D空间中进行编辑,避免传统2D方法的不稳定性。该模型通过残差场预测和深度同步文本注入,实现快速、稳定的3D场景修改,单次编辑约需5秒,速度提升可达120倍。研究团队构建了DeltaScene数据集,以确保多视角下的几何一致性,推动3D编辑技术的发展。
北京大学与阿里巴巴达摩院合作,利用人工智能和卫星影像绘制中国首张高精度风光设施分布图,揭示风电与光伏的互补潜力。研究表明,跨区域协同可显著提升新能源利用效率,减少“弃风弃光”现象,为电力规划提供重要参考,助力实现“双碳”目标。
字节Seed与北大合作提出“原地测试时训练”(In-Place TTT),使大模型在推理时无需重训练即可更新参数,从而提高计算效率和适应能力,尤其在长文本任务中效果显著。
北京大学团队提出的新稀疏注意力机制HISA,速度提升2-4倍,几乎不损失精度。该机制通过块级粗过滤和块内精挑字符,降低索引器成本,适应超长文本需求,工程友好性强。测试结果显示HISA在速度和精度上表现优异,未来可进一步优化块特征计算和训练方式。
电子游戏通常常被理解为一个规则系统,关于游戏的研究也大都以此常识为基础。但是,规则往往并非玩家直接感受到的对象。比如在经典关卡“马里奥1-1”中,宫本茂并不是直接告诉玩家,而是利用渐次升高的水管引导玩家理解长按A键可以跳得更高。游戏设计师大卫·卡纳加认为我们需要区分两个相关的概念,“规则”和“力”:“规则”是玩家可以选择遵守和不遵守的;而“力”则像自然规律一样,只要进入这个场域就只能被迫遵循...
北京大学彭宇新团队提出了分类感知表征对齐方法TARA,旨在解决多模态大模型在生物类别分层识别中的挑战,提升细粒度和分层视觉识别的准确率。该方法通过对齐大模型与生物基础模型的表征,注入类别树知识,从而增强模型的识别能力。
小米MiMo团队由北大学子主导,迅速崛起于大模型研发领域,凭借深厚的科研背景和技术经验,展现出高效的产品开发能力和全球竞争力。
谷歌与北大合作开发的PaperBanana能够100%精确生成学术论文插图,效果优于传统方法。该工具通过五个智能体协作,提升图表的美观性和逻辑清晰度,已在GitHub上获得上千个star,受到研究者广泛认可。
刘若川,1980年生,北大数院新院长,首位“80后”院士,曾获国际数学奥林匹克金牌。他在算术几何与代数数论领域有重要贡献,获得国家自然科学奖二等奖和拉马努金奖。
蚂蚁健康与北大王俊院士团队发布全球首个专病循证评测框架GAPS,专注于肺癌,包含92个问题和1691个临床要点,旨在提升医疗AI的评测深度与可靠性。GAPS通过四个维度评估AI的临床能力,克服现有评测的局限,推动医疗AI向临床应用转型。
音频驱动的视频生成已成为多模态生成的重要方向。北京智源等机构提出了一种音画同步框架,通过将音频拆分为语音、音效和音乐,提升了视频生成的时序控制和音画对齐精度。实验结果显示,该方法在视频质量和同步性上显著提升,验证了音频解混与多流控制的有效性。
文章讨论了人工智能在各领域的应用,强调其在提升效率和决策支持方面的重要性,并提及AI技术的快速发展对未来工作的影响。
GPT-5.2系列在多个领域超越谷歌Gemini 3 Pro,特别是在表格、PPT、代码和长文档处理能力上显著提升,效率提高390倍,成本大幅降低,科学研究和视觉理解表现优异。新团队成员多为数学专业背景,推动技术进步。
完成下面两步后,将自动完成登录并继续当前操作。