Liquid AI发布LFM2.5-VL-3B,31亿参数视觉语言模型,专为设备端设计,支持屏幕理解、函数调用、锚定和多图像输入。在28项基准测试中平均得分69.4,与4.7B模型相当。内存占用约3GB,解码速度228 tok/s。许可证对年收入低于1000万美元的公司免费,高收入需商业许可。
MIT研究人员开发出名为ShiftLens的3D打印系统,无需电子元件即可制造交互式物体。该系统结合光学透镜层与图案层,通过用户按压、滑动或旋转等机械动作改变物体表面显示。用户可输入设计图,系统自动生成可打印模型。应用包括化学瓶安全提示、井字游戏等,未来或用于管道泄漏检测。
HumanEgo框架通过人类第一视角视频学习机器人策略,成功解决了人类与机器人之间的具身鸿沟。研究者利用佩戴的Aria眼镜采集示范数据,实现了零样本迁移,平均成功率达到92.5%。该方法无需机器人数据,数据高效,支持在新环境中稳健迁移,显著提升了机器人操作效率。
韩国科学技术院等研究团队开发了PAVAS技术,该技术能够根据视频中的物理特性生成更真实的音效。它不仅能识别物体,还能推断物体的质量和速度,从而提升音效与视觉的匹配度。此技术有望在影视、AR/VR等领域应用,推动生成式AI的发展。
本文介绍了如何使用TensorFlow和PyCharm构建实时物体检测应用,并将其部署到Reachy Mini机器人上。教程分为两个阶段:第一阶段在笔记本上测试检测管道,第二阶段将其集成到机器人中,实现头部跟踪和实时数据流。使用SSD MobileNet V2模型,用户可以轻松实现物体检测和自定义开发。
麻省理工学院研究人员开发了VisiPrint工具,旨在改善3D打印的外观预览。用户上传设计截图和材料图像后,系统生成准确的外观渲染,减少多次打印造成的浪费。该工具考虑材料的颜色、光泽和透明度,适用于多种3D打印软件,提升设计可视化效果。
麻省理工学院研究人员提出Wave-Former方法,利用毫米波技术实现高精度三维重建,成功克服传统视觉模型的局限,召回率从54%提升至72%,精度保持在85%。研究成果已发布于arXiv。
亚马逊AWS在阿联酋的数据中心因物体撞击引发火灾,可能与导弹或无人机碎片有关。事件影响了AZ2可用区,亚马逊迅速切断电源并迁移服务,导致部分客户连接问题。
卡内基梅隆大学的研究人员开发了一种新型镜头技术,能够同时对不同距离的多个物体进行清晰聚焦。这种“空间变化自动对焦”系统使每个像素都有独立的可调镜头,可能会改变相机的成像方式,适用于摄影、显微镜、虚拟现实和自动驾驶等领域。
麻省理工学院研究团队开发了一种“语音转现实”系统,利用自然语言处理、3D生成AI和机器人组装,根据简单语音指令快速制造物品,如椅子和桌子。该系统通过语音识别和数字模型生成,将用户请求转化为实际物品,提升设计和制造的可及性。团队计划增强家具承重能力,并探索语音与手势控制结合,以实现更灵活的制造。
抱歉,您提供的文本内容过于简短,无法进行有效的总结。请提供更详细的文章内容。
运动物体检测是计算机视觉的重要应用,广泛用于安防和交通分析。本文介绍了如何使用OpenCVSharp中的MOG算法实现该功能,并通过WPF示例展示应用。MOG算法利用高斯模型处理动态背景,结合MVVM模式设计应用程序,并使用形态学操作和轮廓检测识别运动物体。
本文提出了一种自适应空间标记化(AST)方法,旨在高效模拟可变形物体之间的交互。该方法通过将模拟空间划分为网格单元,并将非结构化网格映射到结构化网格上,从而提高计算效率。实验结果表明,该方法在处理超过10万个节点的大规模网格时,显著优于现有技术,并提供了一个新的大规模数据集以支持未来研究。
本文介绍了一种名为“Rooms from Motion”(RfM)的新方法,用于无姿态图像的室内3D物体检测。RfM通过基于图像的3D框替代传统的2D关键点匹配,能够估计相机姿态和物体轨迹,生成高质量的语义3D物体地图。与现有方法相比,RfM在定位性能和地图质量上表现优异,适用于增强现实和机器人等领域。
麻省理工学院研究人员提出了一种新方法,利用视频追踪数据提升视觉语言模型(VLM)在图像中定位个性化物体的能力,如宠物。这种方法提高了定位准确性,为未来AI在物体追踪和辅助技术方面的应用提供了可能性。
浙大校友研发的AI眼镜“Reality Proxy”技术,允许用户通过数字代理选择现实物体,提升人机交互体验。该技术支持物体浏览和属性筛选,适用于信息检索、建筑导航和无人机控制等场景。
麻省理工学院的研究人员开发了“Meschers”工具,将图像和3D模型转化为2.5维结构,帮助用户研究M.C.埃舍尔风格的光学幻觉和独特几何形状。该工具可用于计算曲面上的距离和热扩散,支持艺术家和科学家的创作。
LOVON系统结合大语言模型与开放词汇视觉感知,旨在提升足式机器人在复杂环境中的长时任务执行能力。通过拉普拉斯方差滤波技术,LOVON解决了视觉不稳定性,实现了动态目标下的自主导航与任务规划。
机器之心数据服务现已上线,提供高效稳定的数据获取服务,帮助用户轻松获取所需数据。
机器之心数据服务现已上线,提供高效稳定的数据获取服务,简化数据爬取流程。
完成下面两步后,将自动完成登录并继续当前操作。