2026外滩大会上,四位具身智能从业者围绕数据、智能与商业化展开讨论。数据方面,仿真与真机应分层组合,数据质量比规模更重要。智能方面,大模型难以直接降维打击具身模型,物理接触任务仍是短板。商业化方面,客户持续付费比Demo更重要,需综合模型、硬件、系统与成本。
数据转换是将原始数据清洗、过滤、聚合、连接和标准化为可用数据集的过程,对提升数据质量、支持决策和ETL流程至关重要。它涉及去重、精炼、集成等技术,可通过批处理或流式处理执行,工具选择包括云端、开源或低代码等。Databricks提供Spark声明式管道和Lakeflow Jobs等工具,简化ETL开发,确保数据质量,并支持实时或批量处理,助力企业高效利用数据。
数据治理工具用于编目、保护、监控和审计数据资产,确保数据准确、可发现且合规。核心功能包括数据目录、血缘追踪、访问控制、质量监控和合规报告。工具分为独立目录、点解决方案、企业套件、平台原生和开源五类。评估需考虑可扩展性、集成、易用性、策略粒度、AI治理就绪度、总拥有成本和供应商支持。选择应基于实际需求,通过审计、定义需求、概念验证等步骤,避免忽视AI治理和真实数据测试。
Qdrant向量集合增长会暴露重复、过期数据等问题,导致检索结果质量下降。通过去重、混合搜索优化和添加时效性过滤,可提升答案正确率。评估需结合多个指标,并检查数据源完整性,避免单一指标掩盖问题。
本文系统介绍纯文本LLM监督微调(SFT)训练数据预处理全流程,涵盖数据收集、格式统一、清洗过滤、去重、分布评估、混合策略及打包管理。强调数据质量优于数量,提供多任务采样、语种比例、难度分布等实操建议,并结合客户案例说明,旨在提升模型微调效果。
本文强调,非数据科学家也能从数据科学和AI中受益,关键在于以决策为起点,而非技术。应先理解数据质量,选择简单有效的模型,严格验证,并将分析转化为行动。大型语言模型应视为助手,需保持人类判断。最终,AI应被审慎用于真正改善决策之处,而非盲目跟风。
在RSS 2026机器人顶会上,讨论聚焦于VLA与世界模型的关系,认为两者不冲突,可结合。数据质量比数量更重要,硬件出海领先,但整体领域尚未成熟。全身智能成为新方向,强调系统分层与模块化。中国硬件优势明显,但需避免简单对标美国。
AI在医疗领域通过医学影像分析、临床文档、药物研发等提升诊疗效率,但需人类监督。AI可预测患者结果,准确率约70-72%,受数据质量影响。欧盟AI法案将多数临床AI列为高风险,要求严格治理和人工审查。AI不替代医生,需遵守HIPAA等隐私法规,并持续监控性能以减少偏见。
西门子中国董事长肖松强调,工业AI落地需以具体场景为核心,解决数据质量与模型训练衔接难题。应优先选择高价值场景,如质量检测和铜冶炼,通过软硬融合系统实现全链路闭环,并坚持开放式创新与生态协同。工业AI需长期投入,从单点实效走向生产力跃迁。
训练数据在大模型竞争中至关重要,NVIDIA推出的Nemotron系列数据集强调数据质量和任务适配性,涵盖通用文本预训练、监督微调和代码生成等核心能力,推动模型训练从数量向精准转变。这些数据集为大模型研究提供系统性支持,提升模型能力。
ScaleCUA是清华大学和Z.AI团队提出的框架,旨在解决Computer Use Agent(CUA)训练数据稀缺问题。通过可验证任务合成、动态学习前沿采样和视觉上下文分割,ScaleCUA显著提升了数据质量和训练效率,使开源CUA在OSWorld上达到了68.7%的新高,超越了参数量大四倍的竞品。这一方法强调了数据质量的重要性,证明了在CUA领域,数据效率优于模型参数规模。
本文探讨了如何利用大型语言模型(LLM)和规则系统解决配置管理数据库(CMDB)中的数据重复问题。通过四个阶段的流水线,LLM提取非结构化文本中的结构化属性,规则层负责判定重复。这种方法有效应对命名不一致和数据质量等挑战,确保数据的准确性和可审计性,最终提升CMDB的数据治理效率,适用于多种场景。
澳大利亚企业在新财年增加了AI预算,但面临数据基础薄弱的问题。研究显示,80%的决策者担心高使用率被误认为生产力提升,只有8%跟踪实际收益。大多数企业未重视数据质量,导致AI效果不佳。尽管AI改变了工作方式,提升了员工价值创造,但企业需重建数据基础,以确保AI投资的有效性。
企业领导者关注如何投资人工智能以获得最大价值。成功企业通常具备良好的数据基础、专注于高效工作流程,并将治理视为设计要求。客户服务、预测分析和个性化是AI应用的潜力领域。数据质量是成功的关键,约占75%。企业应优先清理和组织数据,以确保AI有效运行。
DataOps将DevOps原则应用于数据管道,以加速交付和提高数据质量。通过自动化数据工作流和促进跨职能团队协作,DataOps持续改进数据质量,强调将数据视为产品,推动快速迭代和反馈,显著降低数据停机时间和运营成本。实施DataOps的组织报告数据停机事件减少高达99%。
随着云原生架构的复杂性增加,工程团队面临遥测数据过量的问题,许多指标未被查询,导致存储和工程负担加重。为减少资源浪费,团队需明确健康系统的标准,优化遥测信号,并结合自动化与手动仪器以确保数据质量。同时,关注AI系统的概率特性,调整遥测定义,以评估系统的可靠性和成本效益。
数据工程在人工智能中扮演着重要角色,涉及数据管道构建、特征工程和合规性。数据工程师需确保数据质量,以支持AI模型的训练与部署。AI驱动的自动化提高了数据处理效率,但也带来了数据质量和可扩展性挑战。生成式AI能够生成合成数据,帮助解决训练数据不足的问题。数据工程师需与数据科学家紧密合作,确保数据的可靠性和合规性,以推动AI项目的成功。
AnySearch是一款专为AI Agent设计的搜索服务,旨在提升搜索质量并减少搜索调用次数。上线首月吸引了10万开发者,成为热门工具。它采用自建数据管线,确保数据质量和稳定性,未来将继续迭代技术以推动商业化发展。
客户细分是将客户群体根据共享特征划分为小组,以便定制营销和服务。有效的细分可以提高客户留存率、增加客户终身价值并减少广告支出。现代细分方法结合多种数据类型,AI和机器学习使细分更精准和实时更新。定期审查细分以确保数据质量和准确性是成功的关键。
客户互动数据分散在多个系统中,导致AI客服面临数据碎片化问题。专家建议企业应构建统一的客户档案,以提高AI的决策准确性。治理框架和数据质量对确保AI有效运作及提升客户体验至关重要。
完成下面两步后,将自动完成登录并继续当前操作。