2026年上半年,国内具身智能领域融资约438亿元,预计将超过去年全年。资金主要流向强调软件定义硬件的“大脑派”公司,融资速度加快,许多早期公司获得巨额融资。世界模型成为热门技术路线,人才多来自高校。尽管存在泡沫,投资人仍看好具身智能的市场潜力,认为其将改变产业格局。
绘图工具是用于创建和编辑视觉内容的数字平台,涵盖从基础素描到高级图形设计的各种应用。
本研究提出PASTA方法,解决条件3D形状生成中的信息损失和用户意图最大化问题。通过融合用户素描和文本描述,提升了素描的语义表示和部件级编辑能力,实现了先进的素描到3D形状生成效果。
本研究针对传统机器人操作策略训练中对大量示范和环境模拟的需求问题,提出了Sketch-to-Skill框架,利用人类绘制的2D草图轨迹来引导强化学习。该方法创新性地结合了草图到3D轨迹生成,生成初步示范,显著提高了机器人操作学习的可访问性和应用范围。实验结果表明,该框架的性能接近依赖于遥控示范数据的基线模型,并大幅超越了单靠强化学习政策的表现。
本文介绍了如何使用Python将照片转换为素描,主要通过灰度转换、高斯模糊和“冲淡”效果实现。用户需安装相关库,并可调整模糊强度以获得不同效果。
使用Python和OpenCV库,可以将照片转换为铅笔素描。该项目通过简单的代码实现图像处理,主要步骤包括读取图像、灰度转换、反转、模糊处理和生成素描,适合初学者和开发者,具有良好的扩展性。
本文介绍了一种基于Transformer的扩散模型,提出了多种优化方法以提高生成性能和推理效率,包括掩码Transformer、稀疏模型DiT-MoE和混合专家模型EC-DIT。这些方法显著降低了训练时间和计算负担,同时在图像生成质量上取得了优异成绩,推动了扩散模型的发展。
本研究提出了多种基于深度学习的面部素描生成方法,包括卷积网络、生成对抗网络(GAN)和扩散模型,显著提升了素描的质量和可辨识度。这些方法在多项基准测试中表现优于现有技术,展示了在面部艺术风格化和图像转换方面的潜力。
本研究针对传统注意力模型在长序列任务中的计算复杂度问题,提出了一种名为S$^3$Attention的新型结构,利用平滑骨架素描有效平衡信息保留与计算减少的关系。该方法通过引入平滑块和矩阵素描技术,显著提高了信息处理的效率和准确性,并在多项数据集上表现出优于传统注意力模型及其他先进变体的性能。
我们提出了一种半监督的多模态素描提取方法,能够通过非配对数据训练来模仿给定参考素描的风格,并在定量和定性评估中优于最先进的素描提取方法和非配对图像翻译方法。
通过手势示意、无需硬件和标记物,直接生成清晰的素描图。
本文探讨了零样本学习在草图图像检索中的应用,提出了一种新框架,通过对比文本间接对齐素描与照片,避免了成对样本的需求。研究表明,该方法在多个数据集上表现优越,有效实现了跨模态内容检索。
本文介绍了一种基于深度对抗图像合成的框架,能够结合草图和稀疏颜色生成逼真的图像。用户通过涂鸦指示颜色,系统实时反馈编辑效果。该方法生成高保真度图像,支持用户调整形状和比例,并在多模态着色和边缘增强方面表现出色,有效改善了色彩渗透问题。
本文提出了一种自监督方法用于场景素描生成,该方法不依赖于任何现有的场景素描,可将单对象的素描转化为场景素描。通过引入矢量素描字幕和素描语义扩展方法,并设计一个融合多模态感知约束的生成网络,适用于零样本图像到素描的下游任务,实验证明其具有最先进的性能。最后,通过我们提出的素描生成方法,我们贡献了一个以场景素描为中心的大规模数据集,包括高度语义一致的 “文本 - 素描 - 图像”...
借助 Diff3DS 框架,通过在 2D 图像域中计算的梯度,实现了 3D 草图的端到端优化。该框架可以用于文本到 3D 草图和图像到 3D 草图的生成任务,支持基于蒸馏的监督学习,如 Score Distillation Sampling (SDS)。大量实验证明了该框架的潜力和有望的结果。
本文介绍了多种生成式语言模型的创新,包括RecycleGPT、StockGPT和D-iGPT。StockGPT在股票收益预测中表现优异,年收益达到119%。D-iGPT通过语义标记提升视觉内容理解,显示出生成型人工智能在复杂金融决策及其他领域的潜力。
本研究提出了一个大规模艺术图像数据集,并采用新方法评估艺术图像的美学表现。通过构建多属性图像美学评估方法,结合深度学习技术,实验结果显示该方法在美学评分上表现优异,为未来研究奠定基础。
本文提出了一种新颖的零样本基于素描的图像检索方法,通过对比文本间接对齐素描与照片,避免了成对样本的需求。该方法在分类和匹配上表现优越,有效解决了领域差异和大规模检索问题,并提供了新的数据集QuickDraw-Extended,实验验证了其在多个数据集上的优异性能。
本文提出多种基于深度学习的漫画处理技术,包括自动漫画滤镜生成、漫画着色方法和漫画检索系统。这些方法有效降低创作成本,提高图像质量和检索精度,同时保留原始风格。
本文探讨了多种基于扩散模型的图像合成和编辑方法,包括通过用户草图生成图像、个性化漫画制作和利用自然语言生成手绘素描等。这些方法旨在降低艺术创作门槛,提升用户参与度,并展示图像生成性能的优势。
完成下面两步后,将自动完成登录并继续当前操作。