小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
还在为大模型洗数据熬夜?蚂蚁拿下VLDB工业最佳论文,一套宽表搞定35PB语料,效率狂飙5.6倍

蚂蚁集团研发的统一宽表系统OmniTable获VLDB 2026工业赛道最佳论文。该系统管理超35PB、3050亿条大模型训练数据,通过逻辑统一、物理分离设计,将数据批次和特征列作为一等对象,简化数据定位、特征回刷和结果追溯。实际应用中,SFT数据准备周期从14天缩短至2.5天,手工步骤减少73.3%,显著提升数据工程效率。

还在为大模型洗数据熬夜?蚂蚁拿下VLDB工业最佳论文,一套宽表搞定35PB语料,效率狂飙5.6倍

量子位 量子位 · 2026-09-02T06:20:17Z
为AI时代而构建:VLDB 2026上的Lakebase、流处理与湖仓创新

Databricks将在VLDB 2026展示多项创新,包括Reynold Xin的主题演讲,介绍AI代理时代数据库工程的“第三黄金时代”,提出Lakebase和LTAP新范式。四篇论文涵盖Lakebase架构、Spark Structured Streaming演进、AutoLiquid自动数据布局优化及Ultron历史查询优化,另有Enzyme演示,旨在提升湖仓性能与实时分析能力。

为AI时代而构建:VLDB 2026上的Lakebase、流处理与湖仓创新

Databricks Databricks · 2026-08-27T15:22:00Z
VLDB 2024广州之旅

VLDB 2024会议在广州举行,汇聚全球研究人员,讨论数据管理等领域的前沿话题。会议包括开幕式、主题演讲和分组报告,参与者还体验了广州的文化和美食,参观了历史景点,感受了广州的历史与现代交融。

VLDB 2024广州之旅

逐水寻源 逐水寻源 · 2024-09-23T03:02:06Z

VLDB 2024将于2024年8月26日至8月30日在中国广州举行,会议涵盖了数据管理、数据库架构、图形数据管理、数据隐私与安全、数据挖掘、机器学习、人工智能和数据库系统研究等领域的问题。TiDB将有三篇论文和一个Demo Paper亮相,其中一篇论文介绍了AutoTQA,一个自主的多表格问答框架,另一篇Demo Paper介绍了OSSInsight,一个用于GitHub数据分析的开源工具,还有一篇论文介绍了StarBench,一种新型的星型模式基准测试。

VLDB 2024丨与 TiDB 一起探索数据库学术前沿

TiDB_PingCAP 的博客 TiDB_PingCAP 的博客 · 2024-08-27T22:39:21Z

hyper.ai在其官方网站上推出了一个名为“顶级会议”的新栏目,提供CCF A级计算机会议的最新信息,包括会议介绍、提交截止日期和提交链接。该网站还提供了一系列高质量的公共数据集、教程和社区文章。此外,hyper.ai还提供即将举行的会议信息,并定期更新内容。

VLDB ’25 最后 6 天截稿,58 个顶会信息纵览;ISPRS 城市分割数据集上线

HyperAI超神经 HyperAI超神经 · 2024-05-28T09:35:16Z

hyper.ai官网上线了CCF A类计算机顶会信息板块,提供会议简介、截稿倒计时、投稿链接等,同时还提供优质公共数据集和教程精选。

VLDB ’25 最后 6 天截稿,58 个顶会信息纵览;ISPRS 城市分割数据集上线

HyperAI超神经 HyperAI超神经 · 2024-05-27T03:00:05Z
可组合数据系统之路:对过去 15 年和未来的思考

2024年3月11日,一篇关于可组合数据管理系统VLDB的论文已发布,探讨了数据科学的发展和数据分析工具的演变,以及当前面临的挑战。文章介绍了一些与数据管理和分析相关的开源项目,如Apache Arrow、RAPIDS、DuckDB和Ibis等,致力于提高数据交换、查询执行和编程接口的模块化和互操作性。作者对未来的发展持乐观态度,并预测将出现新一轮的用户界面生产力投资浪潮。

可组合数据系统之路:对过去 15 年和未来的思考

姬涛 姬涛 · 2024-03-11T00:00:00Z

华为云数据库团队发表论文介绍了其采用Shared-storage架构提高云原生数据库性能和稳定性的多主技术突破,经测试性能表现优异,采用VS时钟和混合行页锁技术,降低网络负载和提高性能。华为将于2023年9月20-22日在上海举办第八届华为全联接大会,以“加速行业智能化”为主题。

多主架构:VLDB技术论文《Taurus MM: bringing multi-master to the cloud》解读

华为云官方博客 华为云官方博客 · 2023-09-14T09:57:51Z

随着业务增长和云原生技术的发展,云原生分布式数据库产品不断涌现。字节跳动提出了CDSBen模型,利用机器学习预测存储层的IO pattern,实现真实的benchmark。CDSBen包括IOPS序列预测模型和联合分布预测模型,通过训练模型和改造后的YCSB工具进行基准测试。CDSBen的优势在于准确、灵活和易用。实验结果显示,CDSBen生成的读写请求性能更贴近真实业务流量。

VLDB 2023 | CDSBen: 字节跳动 veDB 数据库存储系统性能测试模型

字节跳动技术团队官方博客 字节跳动技术团队官方博客 · 2023-09-02T02:02:15Z

阿里云操作系统团队、阿里云数据库团队和上海交通大学新兴并行计算研究中心联合撰写的论文“Async-fork”提出了一种解决IMKVS快照期间查询延迟大幅增加的问题的方法,将fork调用过程中最耗时的页表拷贝部分从父进程移动到子进程,并设计了一种主动同步机制,确保PTE在修改前被复制到子进程,实验结果表明,Async-fork显著减少了快照期间到达请求的尾延迟。引入双向指针,用于快速判断一个VMA的所有页表项是否已经复制到子进程,以及错误处理。

入选数据库顶会 VLDB:如何有效降低产品级内存数据库快照尾延迟?

阿里云云栖号 阿里云云栖号 · 2023-03-02T03:39:14Z

《Index Checkpoints for Instant Recovery in In-Memory Database Systems》是由华为云数据库创新Lab一作发表在数据库领域顶级会议VLDB'2022的学术论文。

VLDB‘22 HiEngine极致RTO论文解读

华为云官方博客 华为云官方博客 · 2022-09-09T07:38:18Z

云数据库实现计算存储分离,支持计算与存储的独立扩展,其用户还可以享受按量付费等特性。这使得基于云数据库的系统更加高效、灵活。因此,构建并使用云原生数据库的势头愈演愈烈。另一方面,云化存储服务已经是云的标准能力,存储侧提供兼容通用的文件接口,并且不对外暴露持久化、容错处理等复杂细节,其易用性和规模化带来的高性价比使得云存储成为了云上系统的第一选择。在通用云存储服务上构建云数据库,无疑是一种既能...

PolarDB-CloudJump:优化基于云存储服务的云数据库(发表于VLDB 2022)

baotiao baotiao · 2022-07-04T00:00:00Z

云数据库实现计算存储分离,支持计算与存储的独立扩展,其用户还可以享受按量付费等特性。这使得基于云数据库的系统更加高效、灵活。因此,构建并使用云原生数据库的势头愈演愈烈。另一方面,云化存储服务已经是云的标准能力,存储侧提供兼容通用的文件接口,并且不对外暴露持久化、容错处理等复杂细节,其易用性和规模化带来的高性价比使得云存储成为了云上系统的第一选择。在通用云存储服务上构建云数据库,无疑是一种既能...

PolarDB-CloudJump:优化基于云存储服务的云数据库(发表于VLDB 2022)

baotiao baotiao · 2022-07-04T00:00:00Z
  • <<
  • <
  • 1 (current)
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码