腾讯云数据湖计算发布会:Spark与Ray一体化重构Agent数据底座
时间:2026-08-05 | 作者:实验室老王 | 阅读:0从一个很直观的现象说起:当AI Agent不再只是聊天框里的“能说会道”,而是真正进入生产环境去执行任务,企业数据平台面临的变化,远不止是多了一种应用形态。数据形态、计算资源、训练范式、开发方式——这四个维度几乎同步在变。7月25日,DataFun Agentic AI Summit 超级智能体系统架构峰会·深圳站,腾讯云大数据专场给出了一个相当明确的答案:
整个专场的基调很清晰:Agent时代的数据底座,不能再把数据处理、模型训练、在线推理和Agent运行拆成各自为政的孤岛,而必须让数据、算力、模型、轨迹与反馈在同一套基础设施上持续循环。腾讯云在现场正式发布了智能数据湖计算 AI DLC,定位为业内首个生产级Serverless Spark + Ray全托管平台。
数据不再只是记录,数据底座开始为Agent提供可信上下文
腾讯云大数据基础产品总经理 程彬
腾讯云大数据基础产品总经理程彬用了两个非常典型的场景来说明数据角色的变化——智能汽车和AI原生导购应用。传统汽车的功能在交付时基本固化,但智能汽车不一样,它通过持续采集、云端连接和OTA升级不断迭代;传统导购APP主要记录浏览、加购和订单,AI原生导购还要理解用户意图,结合对话、图片、商品、库存和历史偏好主动完成任务。
这背后意味着什么?数据不再只是用来查报表、复盘的运营记录,它正在成为Agent获取上下文、形成判断和持续学习的“认知燃料”。现场提出的新任务是:数据底座必须保证每一轮智能决策都能获得可追溯、可解释、可即时调用的上下文,并让模型训练、运行反馈和持续优化形成闭环。
放到架构上来看,底层需要一个统一的Context平面,集中管理业务数据、知识、特征、模型、服务以及Agent轨迹和记忆;中间层要同时承载检索、SQL、模型训练、推理、代码执行、上下文构建和评测反思等多种计算;上层则承载能持续优化并自主完成复杂工作的Agent应用。数据湖的目标,也从“存好、算好结构化数据”,转向了持续为智能系统提供可信上下文。
AI时代的数据底座要保证每一轮智能决策获得可追溯、可解释、可即时调用的上下文
AI DLC发布:四项升级把数据、算力和Agent闭环放到同一底座
腾讯云大数据DLC产品负责人 孟硕
腾讯云大数据DLC产品负责人孟硕在发布环节梳理了AI/Agent时代在四个维度上的变化:数据从结构化走向多模态,资源从CPU走向CPU+GPU异构分布式,企业训练重点从预训练转向基于私有数据的后训练,数据工程也从追求“一次写对”的确定性流程,转向依靠轨迹、反馈和评估不断迭代的系统。
针对这些变化,AI DLC按照支持异构、AI原生开发、数据算力同底座、面向Agent进化四条设计思路完成了升级。产品层面对应四项能力:以Ray × Spark升级计算范式;以Xpark、Ray Libraries和Meson补齐多模态处理、训练推理与结构化高性能计算;以TCLake建立Data+AI统一元数据和全流程血缘;以Open Engine、MCP、Skills、SDK和Open API让平台既能承载Agent,也能被外部Agent调用。
这套架构里,Spark负责大规模数据加工、特征工程和结构化分析,Ray承载多模态处理、模型后训练、在线推理和Agent运行时;二者共享统一的资源池、数据与元数据底座。数据对象和AI对象也被放入同一治理链路——从表、文件和Topic,到特征、模型、Checkpoint、服务端点以及Agent轨迹和记忆,都可以被统一纳管和追溯。
从数据湖计算DLC到智能数据湖计算AI DLC的四项升级
三大核心引擎:分别补齐AI计算、多模态处理和结构化性能
腾讯云大数据AI计算平台研发负责人 祝森林
腾讯云大数据AI计算平台研发负责人祝森林详细介绍了TCRay。简单说,TCRay把开源Ray的分布式运行时转化成了可供多团队长期使用的生产级平台。它在AI DLC中连接数据湖与智能应用,覆盖多模态处理、模型训练、强化学习、在线推理和GenAI应用。
现场披露的建设进展很实在:TCRay已完成3000节点、10万Actors的规模化测试;GCS稳态内存下降40%,Idle Worker内存下降90%。在一项12小时、包含1339万Events的历史作业场景中,History Server加载耗时由分钟级降至秒级,加载耗时下降98%,峰值内存下降99%。平台侧还补充了多租户、资源队列、弹性伸缩、流量控制、高可用和统一运维可观测能力。
TCRay的规模化、历史可观测和生产平台能力建设进展
腾讯云大数据Xpark研发负责人 蔡晓帆
腾讯云大数据Xpark研发负责人蔡晓帆则聚焦多模态数据处理这个AI落地的前置瓶颈。
Xpark是面向多模态数据处理的自研引擎,基于TCRay提供Xpark Dataset、DataFrame和AI Function,内置50余种图片、文本、音频、视频及LLM算子,并支持UDF迁移已有业务逻辑。现场测试中,在CLIP图文匹配场景下,Xpark推理吞吐相较开源Data-Juicer提升3倍,GPU利用率长期接近100%;Exact Substring Dedup相较开源Text-dedup单机算子快47.8倍。通过模型级联和判别式算子,部分场景可减少70%的大模型请求——注意,这里指的是调用次数。
Xpark通过内置多模态算子降低开发门槛,并用模型级联减少大模型请求
腾讯云大数据专家工程师 黄海升
腾讯云大数据专家工程师黄海升带来的Meson引擎则专注结构化数据高性能计算。
Meson是面向结构化数据的高性能向量化引擎,核心能力包括向量化算子、Pipeline执行模型、高性能IO和自适应优化。腾讯云现场披露的1TB TPC-DS测试显示,Meson相较社区Spark整体性能提升3.6倍,部分计算密集型查询提升5倍;CPU使用率由80%降至40%,集群IO吞吐由12Gbps提升至20Gbps,瓶颈由CPU转向IO。产品同时保持对Spark API、SQL、UDF和生态组件的兼容,便于存量作业迁移。
Meson在1TB TPC-DS测试中的性能、CPU使用率与IO吞吐对比
博世两项实践:统一算力底座与模型驱动的数据生产飞轮
博世中国数据平台技术专家 王磊
博世中国数据平台技术专家王磊围绕Ray on TKE混合计算调度实践,分享了在线推理、数据处理和模型训练对统一算力底座的共同需求。传统资源按组或业务线切分,容易出现资源孤岛、峰谷错配和多人共享冲突;统一平台则通过TKE资源池、KubeRay与API接入,将Ray Job、Ray Serve、Spark和自定义Pod纳入统一调度。
现场PPT将两个关键收益概括为“开发即产线”和“排队与抢占”:开发环境、训练环境和推理环境保持一致,任务可按优先级使用异构资源,避免各团队分别建设和维护集群。具体链路中,Ray Serve通过流水线并行和单卡多实例提升GPU利用率,Ray Data将海量预处理拆分为可独立重试的分片,避免中间失败导致整条长链路重跑;训练侧则统一调度不同类型的GPU/DCU集群,使从开发环境申请、训练任务发起、推理部署到业务交付形成完整闭环。
博世Ray混合计算实践将资源申请、训练、推理和业务交付连接为统一闭环
博世中国智驾数据产品专家 陈立贤
博世中国智驾数据产品专家陈立贤进一步分享了以Lance作为数据中心、Ray作为任务中心的智驾训练数据实践。Lance统一管理图像、视频、点云等Dense数据与标签、元数据、模型输出等Sparse数据,使它们共享同一数据集身份、版本与血缘;Ray则统一管理任务提交、资源、状态和结果聚合,让本地验证完成的任务可以使用同一任务模型扩展到集群。
这套架构把数据生产组织为模型问题驱动的闭环:模型问题转化为数据需求,随后完成数据挖掘、自动标注、人工修复、可训练数据集版本化交付,再进入训练与在线评测。与过去“湖仓交付后仍需多次统计、对齐和搬运”不同,新的交付对象本身就是可直接被训练和评测消费的数据集。
WorkBuddy实践:把数据处理、后训练和权限治理串成闭环
腾讯CodeBuddy/WorkBuddy Infra负责人 张凯
腾讯CodeBuddy/WorkBuddy Infra负责人张凯以WorkBuddy数据实践为例,分享了业务增长后集中间出现的三类问题:数据处理任务和体量快速增加,对话、长文档等超大字段给常规读取和解析带来压力,同时算法、模型训练、BI、风控、运营和数据科学等多个团队需要在严格权限边界内使用同一批数据。
接入AI DLC后,业务数据、对话文档和行为日志先进入对象存储与TCLake,再由Serverless Spark × Ray和Xpark完成数据准备、多模态处理、后训练与推理。存储与算力可以独立扩展,Spark与Ray共享数据底座,MCP和Open API则让底座能够被Agent编排调用。针对超大字段,方案通过列式读取、冷热分离和Xpark多模态算子减少无效扫描,并在峰值任务中按需扩容。
现场PPT公布的数据显示,WorkBuddy同数据集实测数据处理耗时从5小时降至1小时,吞吐提升5倍,按同等负载换算CPU使用率下降80%;通过API串联Agent轨迹入湖、Xpark特征提取、Ray Train后训练和评估回流后,数据到训练的交付周期缩短70%,人工搬运减少90%。这些数据在PPT中注明以内部报告口径为准。
除性能外,TCLake还把数据加工、特征工程、模型训练、模型服务以及Agent轨迹和记忆纳入同一血缘体系;权限中心支持库、表、行、列级授权,并对操作过程全程留痕。对于需要持续后训练的Agent应用,这意味着数据处理效率、训练闭环和跨团队治理可以在同一平台内协同完成。
WorkBuddy通过API串联轨迹入湖、数据处理、Ray Train后训练与评估回流
从产品发布到生产实践,数据平台服务的对象变成了“持续进化链路”
从当天六场分享可以清晰看到,AI Native数据湖并不是在传统数据平台旁边再增加一组AI功能,而是重新组织数据处理、模型训练、在线推理和Agent运行之间的关系。Spark与Ray负责不同类型的工作负载,TCLake统一管理数据和AI元数据,TCRay、Xpark、Meson分别解决生产级AI计算、多模态处理与结构化性能问题,轨迹、记忆和评估结果则回流到数据与训练链路中。
这也是本次专场最重要的技术变化:平台不再只优化某一次ETL、查询或训练任务,而是优化从数据进入、加工、训练、部署、反馈到再次训练的整体周转效率。腾讯云在现场提出,TCRay后续将围绕“多、快、好、省”继续演进;AI DLC在2026年下半年也将持续推进产品迭代、客户共建验证、数据核心资产价值探索和开放生态建设。
当Agent真正进入企业生产环境,数据底座的竞争不再只是谁能存更多数据、跑更快SQL,而是谁能让多模态数据、异构算力、模型和Agent反馈在一套受治理的基础设施上持续循环。AI DLC的发布以及博世、WorkBuddy的现场实践,给出了腾讯云在这一方向上的阶段性答案。
免责声明:文中图文均来自网络,如有侵权请联系删除,心愿游戏发布此文仅为传递信息,不代表心愿游戏认同其观点或证实其描述。
相关文章
更多-
- 苹果春季发布会时间公布 官网隐藏彩蛋曝光
- 时间:2026-08-21
-
- 真我GT2 Pro发布会核心内容一览
- 时间:2026-07-22
-
- 苹果春季发布会将带来哪些最新硬件新品
- 时间:2026-07-22
-
- 苹果9月发布会史上最大规模新品潮看点
- 时间:2026-07-11
-
- 发布会进入倒计时2天 两大全新玩法即将揭晓
- 时间:2026-06-29
-
- 苹果秋季发布会邀请函彩蛋 Safari浏览器可查看
- 时间:2026-06-25
-
- 苹果春季发布会直播观看方法
- 时间:2026-06-24
-
- 汽车已是快消品!今年5个月国内车企开400多场发布会 推500多款新车
- 时间:2026-06-17
精选合集
更多大家都在玩
大家都在看
更多-
- 以下哪种食材被称为“地下苹果” 蚂蚁庄园今日答案9.18
- 时间:2026-09-17
-
- 蚂蚁庄园今天答题答案2026年9月18日
- 时间:2026-09-17
-
- 蚂蚁庄园答题今日答案2026年9月18日
- 时间:2026-09-17
-
- 蚂蚁庄园小课堂2026年9月18日最新题目答案
- 时间:2026-09-17
-
- 小鸡答题今天的答案是什么2026年9月18日
- 时间:2026-09-17
-
- 蚂蚁庄园每日答题答案2026年9月18日
- 时间:2026-09-17
-
- 蔬菜洗完掉色,说明是被染色了,是真的吗 蚂蚁庄园今日答案9月18日
- 时间:2026-09-17
-
- 满襟蜡绘花纹巧染就花纹当绣裳说的是哪种传统技艺 蚂蚁新村今日答案2026.9.17
- 时间:2026-09-17