该论文探讨了深度学习模型中的后门攻击及其检测方法,包括基于触发器反向工程的检测、特洛伊检测器和防御框架T-Miner。研究表明,检测恶意后门的准确率可达92%以上,T-Miner在防御特洛伊攻击方面表现优异。此外,竞赛TDC2023揭示了大语言模型对后门攻击的脆弱性,强调了进一步研究鲁棒性和可解释性的必要性。
完成下面两步后,将自动完成登录并继续当前操作。