本文探讨大脑作为“自回归生成器”的理论,认为大脑通过不断预测下一秒的体验状态,整合记忆、注意力和知觉等功能为统一的预测过程。知觉是主动生成的,记忆是重新生成的,意识则是这一过程的主观体验。这一理论挑战了传统认知心理学,提供了新的理解框架。
本研究解决了视觉语言模型(VLMs)在知觉恒常性方面的能力是否得以掌握的不足。通过对33个VLM进行253项实验,针对色彩、大小和形状恒常性,发现模型在形状恒常性表现与色彩和大小恒常性表现存在显著差异。这一发现为理解VLMs在动态视觉环境中的应用提供了重要洞见。
本文探讨了文本转图片模型(如DALL-E 2、Stable Diffusion)中提示词选择的重要性,提出了一种评估提示效果的技术,并引入手动标注的数据集以衡量提示在图像生成和检索中的表现。研究展示了通过软提示个性化模型的能力,提升生成图像与用户意图的一致性,并提出新的无提示图像合成框架,表现优于传统方法。
本文介绍了多种创新的对话生成和理解方法,如位置感知微调、自动评分模型、长期控制对话生成和个性化对话生成。这些方法在处理长上下文和评估对话性能方面表现出显著优势,推动了对话系统的自动评估和因果推理能力的发展。
本文介绍了多种基于触觉传感技术的研究,包括深度触觉模型、触觉显著性预测、模拟器TACTO及事件驱动的视觉触觉感知系统。这些研究旨在提升机器人在物理交互中的感知能力和控制精度,强调了触觉反馈在场景预测和物体重建中的重要性。
颜色感知和颜色语言研究发现颜色空间和语言模型特征空间一致性,但在主观性和抽象性情况下降低。需要进一步研究。
工程师坚称谷歌的 LaMDA 聊天机器人具有感知能力,谷歌以违反危害商业机密的“就业和数据安全政策”为由将其解雇。
沟通艺术中的知觉检核 这周看到一篇文章总结了 《沟通的艺术》...
时间是生物性的先感知一瞬间,再感知下一瞬间所造成的知觉假象。因果也是。
有意识为我知觉或俘获到我能知觉或俘获到的实相的能力,其余为无意识。
完成下面两步后,将自动完成登录并继续当前操作。