内容提要
随机初始化的神经网络无需训练即可区分图像类别,因其架构经数十年数据筛选固化了“先天偏见”。Transformer也预编码了文本规律。AI自动化架构搜索将加速此过程,但评估标准仍依赖旧数据集,可能放大偏见,决定下一代AI形态。
延伸解读
架构偏见从何而来
文章指出,神经网络架构本身携带的“先天偏见”并非凭空产生,而是数十年间研究者针对CIFAR-10、ImageNet等标准数据集反复试错、淘汰不适者后,将数据分布特征固化在架构设计中的结果。例如,CNN的卷积层、残差连接等细节,都是为自然图像特性量身定制的。这意味着,架构选择看似是技术决策,实则是数据筛选的演化产物。
自动化搜索的双刃剑
Core Automation等公司正用智能体自动化神经网络架构搜索,速度远超人类。但文章警示,若评估仍依赖旧有标准数据集,智能体可能只会优化在这些“考题”上的得分,而忽略真实世界的泛化能力。这如同用历年真题训练学生,考试满分却无法应对实际场景。自动化加速了演化,却未必能纠正方向,反而可能放大既有偏见。
数据决定AI形态的深层影响
文章通过随机初始化Transformer对推特开头词敏感的实验,说明架构偏见不仅限于图像,也影响文本处理。这些偏见源于最初为翻译等任务设计的架构,却沿用至代码生成、数学推理等新场景。这引发思考:若从零为代码任务设计架构,结果可能截然不同。当前AI的“智能”中,有多少来自训练数据,又有多少来自架构携带的历史偏见,难以厘清。
Q&A
随机初始化的神经网络为什么能区分图像类别?
随机初始化的神经网络虽然权重随机,但其架构本身经过数十年数据筛选,固化了适应自然图像结构的“先天偏见”,因此无需训练就能提取有效特征,区分图像类别。
神经随机特征(NRF)是什么?在CIFAR-10上能达到多少准确率?
神经随机特征是将随机初始化的ResNet-18多次初始化后,提取的中间特征拼接而成。在CIFAR-10上,用NRF训练的线性分类器准确率可达60%,高于直接用原始像素训练的42%。
神经网络架构的“先天偏见”是如何形成的?
神经网络架构的“先天偏见”源于数十年研究者针对标准数据集(如CIFAR-10、ImageNet)反复实验和筛选,表现不佳的架构被淘汰,存活下来的架构固化了适应这些数据分布的设计,如残差连接、卷积核大小等。
如果ImageNet换成医学影像,AI架构会有什么不同?
如果ImageNet换成医学影像等不同数据分布,筛选出的架构可能完全不同,因为不同数据分布会筛选出不同的架构特征,例如自然图像有平移不变性,而医学影像可能强调其他结构。
Transformer架构存在哪些局限性?
Transformer最初为机器翻译设计,可能并非代码和数学任务的最优解,其架构固化了“关注句子开头”等翻译相关偏见,用于其他任务时可能需要打补丁,如增加上下文长度或改进注意力机制。
自动化架构搜索可能带来什么风险?
自动化架构搜索可能加速放大人类已有的偏见,因为智能体使用CIFAR-10、ImageNet等标准数据集作为评估标准,可能过度优化这些“考题”而忽略真实世界需求,导致架构缺乏泛化能力。
Core Automation公司是什么来头?其目标是什么?
Core Automation是一家2026年成立的AI公司,创始人为OpenAI前研究副总裁Jerry Tworek,团队成员来自Google DeepMind和Anthropic,包括Ehsan Amid。其目标是建造自动化程度最高的AI实验室,用智能体自动化神经网络架构搜索,并寻求5亿美元融资。
随机初始化的Transformer对文本有什么先验知识?
随机初始化的Transformer对文本的开头词极其敏感,能预先编码“开头词重要”的语言学规律,这源于其最初为翻译任务设计,翻译中句子开头承载大量信息。