大模型Skill开发中,核心术语选择影响巨大:用“漏洞”准确率89.3%,用“风险”仅62.1%。原因是“风险”语义宽泛,触发模型发散性输出,突破约束。构建高质量Skill需结构化工作流、校验循环、定义文件和定制工具。应选窄边界词,用否定清单、硬输出格式锚定边界,并可用语义陷阱检测器自动化排查。
该研究提出了基于评分的对抗生成(ScoreAG)框架,可生成逼真的对抗样本,提高分类器的鲁棒性。ScoreAG 在多个基准测试上表现良好,强调了对抗样本在语义边界上的研究的重要性。
完成下面两步后,将自动完成登录并继续当前操作。