截至2026年中,前沿AI模型仍会自信地编造信息,造成从尴尬到毁灭性的后果。文章列举了Cursor虚构政策、银行聊天机器人误判、律所引用虚假判例、PocketOS代理九秒删库等案例。原因在于模型基于概率预测而非检索事实,训练奖励猜测而非承认无知,内部“我知道”特征可能误触发。建议通过强制弃权、人工验证、限制代理权限和语义熵检测来缓解。
完成下面两步后,将自动完成登录并继续当前操作。