内容提要
阿里硬核少年技术节5.0的博见社活动分为北京工业场和杭州学术场。工业场展示AI在影视制作中的应用,如将横店片场线上化,利用3D空间保证一致性,强调AI从生成内容转向解决问题。学术场则讨论Agent仍处早期,需解决记忆、验证、自我进化等底层能力。两场观点互补,共同指向AI从局部应用到完整系统构建的过渡阶段。
延伸解读
工业与学术视角为何不同
北京工业场关注AI在影视、设计等具体行业的落地,展示如何解决一致性和效率问题;杭州学术场则聚焦Agent的底层能力,如记忆、验证、自我进化。两者差异源于观察维度不同:工业界看重当前能力能否稳定交付,学术界追问能力能否持续增长。这种分歧并非矛盾,而是AI从局部应用到系统构建的必经阶段。
Agent发展阶段的判断标准
与会学者认为,Agent没有统一的进度条。在代码、检索等数字空间,Coding Agent已能接手部分程序员工作;但在现实世界,稳定性和泛化能力仍是难题;而能自主学习的Agent甚至处于“比初期更早”的阶段。判断Agent是否质变,关键看它能否自我验证、修正并沉淀经验,突破基座模型的能力上限。
AI价值从生成内容转向解决问题
美图等企业发现,单个Agent难以完成复杂任务,于是升级为Agent Teams,通过多个专业Agent协作,从市场分析到投放分析,交付可直接使用的商业物料。这标志着AI产品的价值正从“做出内容”转向“解决问题”,能否进入业务流程并带来收入,成为衡量AI能力的关键。
3D空间构建对长视频生产的意义
群核科技指出,视频生成模型在二维像素层面学习,难以理解空间结构,导致长视频中人物、道具易穿帮。其解法是先建立明确的3D空间,固定人物、道具和摄像机位置,再交给视频模型生成,实现“一次搭建,全篇复用”。这使AI视频竞争从单镜头惊艳转向长视频一致性和可控性。
Q&A
阿里硬核少年技术节5.0的博见社活动分为哪两个场次?
分为北京工业场和杭州学术场。北京工业场主题为“AI下一站:从生成内容到构建世界”,杭州学术场主题为“从生成式AI到智能体进化”。
北京工业场展示了哪些AI产业实践案例?
展示了AI在影视制作中的应用,如群核科技将横店部分线下片场扫描重建到线上,形成3D影视基地;虎鲸文娱讨论AI如何进入影视工业流程并理解专业审美;美图则从提供工具转向直接交付成果,如美图设计室组织多个Agent和Skill完成商业物料。
杭州学术场对Agent发展阶段的总体判断是什么?
杭州学术场认为Agent仍处于早期阶段,类似电灯泡刚被发明,电力革命尚未完成。具体而言,Coding Agent已能接手部分程序员工作,但底层技术仍依赖基座模型;具身智能在现实世界中的稳定性和泛化能力不足;真正能自主学习的Agent处于“比初期更早”的位置。
从生成式AI到Agent,是量变还是质变?
多数嘉宾认为偏向量变,因为底层技术范式未变,能力提升主要得益于基模增强、上下文窗口变长等。但山东大学教授韩忠义从产品形态看,Agent从“告诉你该怎么做”变为“自己动手去做”,用户感受到质变。上海人工智能实验室张航帆认为,当成功率跨过临界点,用户体验会突然改变,可视为质变。
Agent获得自我进化能力还缺什么?
缺底层能力,包括:工具调用、长期任务、记忆和安全(郝建业);持续强化学习,形成“生成—评估—训练”循环(温颖);低时延基座模型、自演化强化学习、可学习的长程记忆(周浩);以及Self-Harness,让Agent自动诊断和优化自身运行框架(张航帆)。
群核科技如何解决视频生成中的一致性问题?
群核科技在生成视频前先建立明确的3D空间,将人物、道具、场地和摄像机位置固定,再交给视频模型生成。视频模型负责审美和语言控制,3D模型负责一致性,实现“一次搭建,全篇复用”,并将3D片场与视频Harness结合,降低长视频制作成本。
北京工业场和杭州学术场的观点为何看似矛盾?
两者并不矛盾,而是互补。北京工业场展示AI在具体行业中的现有能力,如将横店片场线上化;杭州学术场则追问底层能力何时能连接成完整系统。工业界让一盏盏灯先亮起来,学术界研究如何搭建电网,共同指向“执行、验证、反馈、更新”的闭环。