长三角安全人工智能安徽省实验室发布星界、星驭、星鉴三大AI安全解决方案

长三角安全人工智能安徽省实验室发布星界、星驭、星鉴三大AI安全解决方案

💡 原文中文,约2400字,阅读约需6分钟。
📝

内容提要

9月19日,首届中国网络空间安全大会AI安全论坛在合肥举办。长三角安全人工智能安徽省实验室发布三大方案:星界治理大模型内容安全,星驭保障智能体应用安全,星鉴实现AIGC内容可信传播。实验室主任刘俊华分享AI安全治理技术进展,方案已落地多个私有化项目,日均调用破亿次。

🔎

延伸解读

三大方案覆盖AI安全关键环节

星界、星驭、星鉴分别针对大模型内容安全、智能体应用安全和AIGC内容可信传播,形成了从模型内生安全到应用运行安全再到内容传播治理的完整链条。这种分层设计回应了AI技术从研发到落地不同阶段的风险,也表明安全治理正从单点防护转向体系化覆盖。

从技术发布到产业落地的验证

实验室方案并非停留在概念阶段:2023年以来持续为讯飞星火大模型升级防护,2025年已落地25个私有化项目,2026年日均调用次数突破数亿次,并承建工信部首个AIGC生成检测处置平台。这些实践数据说明AI安全能力已进入规模化应用,其有效性在真实业务场景中得到检验。

智能体安全治理的攻防一体化思路

星驭方案强调全生命周期管理,从身份权限、Skill安全检测、自动化红队测试到运行监测和事后审计,覆盖了智能体从上线到运营的主要风险点。这种攻防一体化的设计,有助于应对提示词注入、工具滥用、越权操作等动态威胁,同时兼顾业务可用性,为智能体在办公、金融、政务等场景的推广提供安全保障。

AIGC可信传播的技术组合

星鉴通过内容标识、数字水印、AI生成检测和来源追溯等技术,为文本、图像、音频、视频建立可验证的数字身份。这种“嵌入+鉴别”双管齐下的方式,既能主动标识AI内容,也能被动检测深度伪造,为版权保护和来源核验提供依据,有助于提升内容传播的可信度与可追溯性。

Q&A

长三角安全人工智能安徽省实验室在2026年9月19日发布了哪三大AI安全解决方案?

发布了星界、星驭、星鉴三大方案,分别针对大模型内容安全、智能体应用安全和AIGC内容可信传播。

星界大模型内容安全治理方案覆盖哪些环节?

星界面向大模型全生命周期,覆盖数据构建、模型训练、应用上线与持续运营,提供一体化内容安全治理能力,包括训练数据清洗、安全价值对齐、模型安全增强、内容安全护栏、风险监测与人工研判等。

星驭智能体应用安全解决方案如何保障智能体安全?

星驭以身份与权限管理为底座,上线前通过Skill安全检测和自动化红队测试识别风险,运行中监测提示词注入、工具滥用、越权操作等风险并分级处置,事后通过日志回放与全链路审计支撑复盘溯源。

星鉴AIGC内容可信传播治理方案支持哪些模态?如何实现可信传播?

星鉴覆盖文本、图像、音频、视频四大模态,通过内容标识与数字水印建立可验证数字身份,结合AI生成检测与有害内容识别,贯通内容标识、检测核验与来源追溯,提升内容传播可信度与可追溯性。

长三角安全人工智能安徽省实验室的AI安全方案有哪些落地应用成果?

2023年以来持续为讯飞星火大模型升级防护方案,2025年已落地25个私有化项目,2026年日均调用次数突破数亿次;推动智能体Skill扫描上线,承建工信部首个AIGC生成检测处置平台。

刘俊华在演讲中分享了哪些AI安全治理技术进展?

刘俊华分享了在内生安全上从数据源头构建大模型价值对齐体系,建设评测体系与一站式安全评测平台,为大模型内容和智能体安全搭建防护体系与风控运营,在传播治理上采用嵌入和鉴别双管齐下防范AIGC非法滥用。

🏷️

标签

➡️

继续阅读