AI最尴尬的短板,中国科学院出手了

AI最尴尬的短板,中国科学院出手了

💡 原文中文,约3400字,阅读约需8分钟。
📝

内容提要

中科院计算所“知境”团队发布社会心智大模型技术体系,旨在提升AI的情商与信任度。其核心包括SoMBench评测基准(3大维度、17项、71任务)和Zing训练系统,通过FLARE自适应生成新题、OPD防遗忘,使Zing-27B在五项基准上超越GPT-5.5。部署架构Actio按需调用能力,未来应用于家庭看护、多智能体协作等场景,推动社会智能成为AI核心赛道。

🔎

延伸解读

社会心智为何难?

文章指出,社会心智的难点在于同一场景需同时处理角色关系、隐含意图、情绪变化、社会规范等多层推理,普通大模型难以理清。SoMBench测试中,最强模型正确率仅72.08%,无一达到90%,说明该领域仍是“无人区”。这提醒我们,AI在社交场景中的表现瓶颈并非知识不足,而是对人际动态的复杂理解能力欠缺。

训练方法的创新点

Zing系统采用FLARE自适应生成新题,针对模型薄弱环节合成训练样本,避免重复练习;同时用OPD防止遗忘,在探索新路径时保持已有能力。这种“哪里弱练哪里,但每次练新题”的思路,区别于传统堆数据方式,强调结构化训练设计,而非单纯增加参数。

部署架构的实用性

Actio架构强调“按需调用”能力,而非将所有信息塞入上下文。它通过Harness统一编排,根据任务需求选择性激活技能、知识、记忆等支撑,类似经验丰富的社工。这有助于AI在真实场景中做出恰当反应,提升信任度,尤其适用于家庭看护、多智能体协作等需要实时社会推理的领域。

局限与未来方向

文章承认,训练收益能否跨任务、跨文化迁移,Actio能否在长期真实交互中保持稳定,仍需验证。SoMBench作为自研最难基准,当前模型仍有较大提升空间。这表明社会心智工程化尚处早期,但已从“玄学”走向系统化,为AI赢得人类信任提供了基础。

Q&A

中科院知境团队发布的社会心智大模型技术体系是什么?

中科院计算所智能算法安全全国重点实验室“知境”团队于7月24日发布了知境社会心智大模型技术体系,旨在提升AI的情商与信任度,使其在家庭聚餐、团队会议等社会场景中表现更合宜。该体系包括SoMBench评测基准、Zing训练系统和Actio部署架构。

SoMBench评测基准有哪些特点?

SoMBench将社会心智能力拆解为3大一级维度、17个二级维度、71项细粒度任务,包含3481道经专家评审的实例。它通过多题型交叉验证、选项扰动、捷径检测等手段,不仅能评估模型得分,还能精准定位错误模式,如推理链断裂或表面模式蒙对。

Zing训练系统如何实现自我进化?

Zing通过FLARE机制定位模型在诊断集上的短板,并针对性地合成全新训练样本,避免重复旧题。训练分为两阶段:先进行通用社会心智打底,采用Mixed-Reward GRPO强化学习;再进行专项能力强化,针对薄弱环节进行监督微调和困难样本校准。同时,OPD(On-Policy Distillation)防止模型遗忘已有能力。

Zing模型在权威基准上的表现如何?

Zing-27B在五项国际权威社会心智评测基准上综合均值达79.80,超越GPT-5.5的78.44,尤其在HiToM和EmoBench上优势明显。Zing-32B综合均值76.32,略超DeepSeek-V4-Pro。小参数模型如8B和14B在HiToM上分别达到78.08和80.00,超越同尺寸基座模型近12和8个百分点。

Actio部署架构是如何工作的?

Actio采用显式心智状态部署架构,以Harness为统一编排核心,根据任务需求选择性激活技能、知识、记忆和工具四类支撑。推理过程包括理解任务、并行检索、排序裁剪引导推理、离线沉淀经验,避免信息过载,确保AI在真实场景中做出恰当反应。

知境社会心智技术有哪些应用前景?

知境的小参数模型(8B/14B)适合端侧部署,可应用于家庭看护、儿童陪伴、协作机器人等需要实时社会推理的场景。此外,还可用于政策沟通、危机管理、组织变革等决策推演,以及多智能体协作中的心智状态共享,减少认知错位。

为什么社会心智对AI来说很难?

社会心智难在需要同时处理角色关系、隐含意图、情绪变化、社会规范、未说出口的话等多层推理,普通大模型难以理清这些复杂因素。SoMBench测试中,最强模型正确率仅72.08%,无一达到90%天花板,说明社会心智是当前AI的短板。

🏷️

标签

➡️

继续阅读