腾讯大模型落地实操:TACO-LLM推理引擎与腾讯乐享AI功能探索
时间:2026-07-24 | 作者:318050 | 阅读:0大模型进入落地阶段,除了用AI改造现有业务,算力和推理的优化同样是关键实践。这一点,在腾讯两个截然不同的业务线中体现得尤为明显。
推理成本,是当下大模型落地最棘手的难题之一。整个AI行业都在想方设法提高计算资源利用率,让更多推理请求能并行处理。国内的云厂商们也在纷纷优化现有推理架构,甚至推出新的异构算力方案。腾讯此前推出的推理加速引擎Taco-LLM,表现就全面超越了vLLM框架,吞吐性能相比后者以及TensorRT-LLM提升了1到3倍不等。
另一个方向是腾讯乐享——这个在腾讯内部孵化并使用了十余年的知识管理、学习培训和文化构建平台,开始借助AI对知识管理进行深度改造。效果不止是提效,知识的曝光、使用和迭代也大幅提升。AI的加持,甚至让企业知识管理这个原本偏小众的赛道,一跃成了「热门」。
在4月2日的Workshop上,我们邀请到了腾讯大模型相关业务的人员,来分享大模型在腾讯业务上的探索与实践。本文整理自Workshop视频,略有增删。
分享嘉宾:
- 叶帆 腾讯云异构 AI 研发副总监
- 沈林玲 腾讯乐享产品资深架构师
- 李想 腾讯云互联网行业架构副总监
01 大模型倍速推理引擎 TACO-LLM 的设计与实践
分享嘉宾:腾讯云异构 AI 研发副总监 叶帆
TACO-LLM 是基于腾讯云异构计算产品推出的一款大语言模型推理加速引擎,目标就是提升语言模型的推理效能。在和用户交互的全链条中,推理引擎是AI的核心,负责接收请求、处理并给出响应。
整个架构大致是这样:包含客户端、Request Pool 和 Server。Server 对应腾讯云上的云端实例或用户本地集群节点。不同的推理服务实例,按既定API为用户提供服务,同时处理多个请求序列,最终把结果返回给用户。
推理引擎负责协调整个过程,包括计算优化、调度以及多GPU协同。模型以权重形式部署在推理引擎的GPU显存里——我们常听到的LLAMA、国产chatGLM等都属于这种情况。GPU是最底层最重要的计算设备,当然也能用其他加速硬件。
TACO-LLM 的主要亮点
1. 支持 OpenAI 的API输出格式。
TACO-LLM 无缝支持 OpenAI API,同时也支持流式请求。用户直接通过curl就能访问服务,就像用ChatGPT一样。
- 一致性:标准化输出格式确保返回数据结构统一,输出结果更通用
- 实时性:文本生成过程中实时获取输出,无需等待完整响应
- 减少资源占用:流式输出只返回部分响应数据,降低网络传输和资源占用
2. 支持分布式推理方案:Pipeline Parallel(流水线并行)、Tensor Parallel(张量并行)
- Pipeline Parallel:TACO-LLM将大模型推理分为多个stages,支持高效异步执行,减少GPU空闲时间,最大化利用率。
- Tensor Parallel:将一个变量分散到多个设备共同完成计算操作。比如把Multi-Head-Attention的head切分到不同设备,或把MLP的weight切分后用reduce合并。
3. 支持 Continuous Batching(连续批处理)
传统批处理(如Static Batching)会把数据分成固定大小的批次,同进同出。短的请求得等长的请求结束才能返回,模型和计算资源会空闲。对大模型来说这很不合适,因为每个用户的请求长短不一,会造成GPU空泡。
Continuous Batching 解决了这个问题:模型处理完当前迭代后,如果有请求结束,立即返回,不用等整个批次都算完。模型持续工作,空闲时间减少,硬件利用率提升。简单说,以token iteration为粒度,能灵活地对不同请求进行batching。一个请求结束,另一个请求就能插进来一起算,几乎没有空载,最大程度利用GPU资源。
4. 支持 Paged Attention
Paged Attention 是一种内存管理优化方法,处理长序列数据时显著提升效率和性能。它借鉴了操作系统中虚拟内存管理的分页概念,应用到注意力机制中。
传统方案的问题:
- Reserved fragmentation:预先保留的内存空间通常不会被用,造成浪费
- Internal fragmentation:按请求最大长度提前分配内存,浪费
- External fragmentation:内存碎片化导致无法满足连续分配需求
Paged Attention 引入虚拟内存的分页思想,更高效管理 KV cache:
- 将每个序列的KV cache划分为块,每块包含固定数量KV对
- 序列的连续逻辑块通过块表映射到非连续的物理块
- 新tokens生成时,物理块按需分配
5. 支持 Quantization(模型量化)
把模型权重从32位浮点数(FP32)转为8位整数(INT8/FP8),减少存储需求并提升计算速度。好处很明显:更少存储开销和带宽需求,成倍减少显存;更快的计算速度(有对应的低精度tensorcore指令加速);对模型性能影响有限——TACO-LLM自研的量化算法能最大限度保持量化前后性能一致。
TACO-LLM 如何解决大模型推理瓶颈?
目前的Decoder结构大模型,采用auto-regressive decoding process,是串行推理。比如输入"my",输出"name",再把"my name"一起输入,输出"is",如此循环往复。
一个10B模型,用FP16精度存储会产生20GB的IO,计算量约20B FLOP。对A100高端显卡,显存带宽2039GB/s,FP16算力312TFLOPS,算下来IO耗时10ms,计算耗时0.07ms——性能被显存带宽卡死了。
业界有不少方案:降低model size、减少解码步数、重新设计模型结构等。但这些或多或少都有问题。
Lookahead Decoding 是一种提升LLM推理效率的技术。传统自回归模型每次只生成一个token,效率低。Lookahead Decoding 每次迭代不满足于只生成一个token,而是给出多个候选,由目标模型判定哪些正确,一次生成多个token。
腾讯采用Speculative Sampling(预测解码)方式:用一个draft model生成候选token,再用真正要部署的目标大模型验证。传统方案要求draft model“既快且好”,但这样的模型很难获得。业界也有MedusaLLM等多token方案,用额外head辅助生成,但训练成本高,私有化场景很难用。
基于此,腾讯自研了一套高效的优化方案:Training-Free,开箱即用,用户无感。
优化方案设计思路
- 面向通用性设计
- 提高性能的关键在于充分挖掘GPU冗余算力(瓶颈在访存)
- 途径:前向计算产生多个token,在序列维增加并行度
- LLM模型从decoding process变成validation process(并行),validate提前获取的decoding candidate tokens
- 通过Lookahead Cache获取decoding candidates
整体方案分为两大部分
1. 基于批处理的 Lookahead Cache:
- 一次预测批量请求
- 根据batch-size和各个请求的命中率,对copy_len自适应惩罚
- 基于森林的多分支预测方法
有点类似项目数据库的思路,但更轻量。核心洞察是:当前生成的内容很可能在之前的问题或已生成内容中间出现过。如果能匹配前序内容,更大概率输出历史上出现过的一致短语。像内容摘要、总结评论、代码生成这类垂直场景,天然具备这个特性。具体实现:在batch内为每个序列维护自己的local cache,共享全局一个global cache。推理时根据match长度查缓存,通过预设copy程度给出预测,每次迭代根据命中率自适应调整超参。
分词上,相比原始线性分词,采用了森林分词法。多分支方式有多种结果候选,提高迭代命中率;树结构多样,能结合词法语法动态更新拟合pattern;每个请求按各种树结构的权重采样,通过命中情况调整概率;甚至可以简单随机森林自学习,在线学习(在CPU上进行)。
2. 自研的 TurboAttention:
- 基于Paged Attention
- 借鉴融合FlashAttention,节省显存同时解耦片上资源
- Lookahead将向量和矩阵运算转化为矩阵和矩阵运算,有效利用GPU tensor-core加速
- 在Head维使用Double Buffer,实现访存与计算overlap,同时将片上资源与head-size大小解耦
优化策略总结
1. 提高Lookahead Cache命中率,减少无效计算
- 通过森林分词提高decoding candidate tokens命中长度,减少无效计算
- 通过Tree Attention合并相同前序candidate tokens的计算,减少重复计算
- 自适应candidate tokens长度,各序列按自身情况灵活调整(命中率、并发度、自适应惩罚),避免过载GPU冗余算力
2. 提高算力天花板
- 序列维增加的并行度有效利用tensorcore,提高理论算力上限,性能下限和单token解码持平
- 将片上资源使用(SRAM、registers等)和序列长度解耦,有效提升长序列性能
- 通过双buffer设计提高ILP,有效隐藏IO开销
TACO-LLM 性能效果
1. Double buffer加速效果
在各种size下,使用head维double buffer技术,耗时明显减少,最大加速1.77x。
2. 加速上限分析
大多数投机采样的加速方法,只在低并发(batch-size=1)时有效。TACO-LLM的方案,一直到batch-size=128都保持较高加速潜力。以batch-size=128加速上限5.12x为例,假设lookahead=7时平均只命中3.5个token,那么仍有2.88x的加速。
3. 端到端性能
同batch size下,TACO-LLM全面优于vLLM。
- chatglm2-6b-32k:相比vLLM最大提升3.17x,相比NVIDIA TensorRT-LLM最大提升1.77x
- baichuan2-13b:相比vLLM最大提升1.44x,相比NVIDIA TensorRT-LLM最大提升3.0x
- codellama-13b:相比vLLM最大提升2.47x,相比NVIDIA TensorRT-LLM最大提升3.71x
NVIDIA TensorRT-LLM在长序列场景下存在限制:tensor数目限制了batchsize大小;输入tokens小于2k时,由于显存限制最大batchsize只能到32;codellama-13b场景下,只有在batchsize=1时才有性能优势。
02 腾讯乐享基于AI大模型的应用与实践
分享嘉宾:腾讯乐享 资深产品架构师 沈林玲
腾讯乐享:智能化组织学习协作平台
腾讯乐享2008年在腾讯内部诞生,经过15年发展,已是腾讯核心的知识学习和沟通平台。95%的员工每天主动访问,腾讯宝库80%的原创知识都在乐享,内部沉淀文章超过150万篇。2017年产品正式对外开放,目前注册企业数超过30万,覆盖超100个细分行业。
乐享主要解决三个核心场景:知识管理、学习培训和文化建设。
AI 场景落地探索
目前围绕四个环节落地探索:
1. 智能写作
核心目的是降低员工在企业内部的创作门槛,高效完成内容的修缮和规范。对员工来说,日常培训、内容营销需要大量精力创作和审核。对平台运营者来说,企业内部知识因为创作成本高,生产和更新频率降低,最终从“低质量”走向“不可用”。乐享先解决创作成本,提供指令对文档总结、扩写及语言专业化处理等。
2. 智能生成
切入内容领域:课程制作、生成音频文章和课程、生成知识点、生成考题,以及更多内容生成能力。员工可直接导入文本让AI出题,还能进行多模态内容搜索,帮助员工直达所需知识,盘活整个知识平台。长文档也可用AI生成摘要,快速了解信息,提高获取效率。
3. 智能问答
解决平台内容利用率低的痛点。传统检索获取信息链路冗长,每一步都可能信息衰减和失真,平台内容无法实时有效迭代,最终从“低质量”走向“不可用”。乐享将大模型能力和企业内部知识整合,无需训练模型即可快速搭建企业问答专家。能理解企业知识后直接以自然语言回复成员问题,缩信息息获取链路,提高内容曝光。在课程问答上,AI助手可实时解答学员提问,降低提问门槛,解放讲师资源,让讲师专注于课程打磨。
4. 智能学习
还原员工知识学习场景,打破时空限制。比如用AI代替讲师,尤其对培训场景多的企业,可自定义数字形象实现AI陪练,将学习、练习、考试和调研有机结合。还能AI打分,记录在案随时复盘。
03 Workshop 交流:为什么大模型落地这么难
Q:腾讯在知识管理+大模型领域有什么新思考?大模型对此有什么赋能?
沈林玲:知识管理以前是个比较小众和专业的领域,很多企业内部做简单的知识管理,比如网盘文档分享,但知识生命周期管理相对弱。有了大模型后,这个赛道越来越火。很多知识密集型企业会有意识地用AI进行知识管理提效。甚至有些团队之前没做知识管理,现在靠AI一步跨越原有体系。客户也有预算投入,核心还是看乐享能提供的价值和最终解决的问题。乐享作为专业的知识管理SaaS应用,在每个环节基于大模型提效和体验升级。比如知识问答,我们收到了互联网、零售、工业能源、金融、出行等不同行业的强需求。
Q:之前举例A10 * 16部署72B,目前腾讯云部署100B以内的模型主流用什么卡?
叶帆:部署大尺寸模型有几个原则:第一,能不跨机尽量不跨机。跨机涉及较慢的节点间通信,做TP切分时性能衰减厉害。建议客户尽量把大模型部署在显存大的卡上。此外我们有软件技术对模型做量化,模型尺寸减小,更容易满足显卡实际需求。30B以上模型建议直接部署在L20显卡上。腾讯云持续提供异构显卡系列,除了L20系列,后续也会上hopper架构的新显卡,满足不同用户需求。
Q:谈一谈大模型商业化的难题。很多人聊大模型应用,但到头来落地和商业化不理想,为什么?
李想:看一个场景能不能落地,主要看两个方面:一是场景所需人力物力,包括开发工作量,以及需要开发新模型还是基于已有模型微调,这是重要考核指标。二是场景对准确率的要求。有些场景对输出结果准确率要求没那么高,落地就容易些。如果场景需要人力少,准确性要求不高,商业化落地相对容易。比如乐享的场景里制作课程、考题,对内容生成准确率要求不高,就容易些。但像SaaS领域,财税报销、税控、电子签约,大模型现在的幻觉问题不可控,数字错误会引发严重后果,落地就困难些。
Q:目前大模型有哪些典型的实际落地场景?
李想:智能客服应该是大语言模型出来后落地最快的一个场景。传统智能客服依赖规则设置和匹配,结合大语言模型和向量数据库后,对上下文的理解能力和回答精确度显著提升。通过把专业知识整合到向量数据库,大语言模型能提炼问题本质并向量化,在数据库中检索相关信息,更准确地回答问题。与传统方案相比,效果提升明显。这种技术应用前景广阔。
第二个场景是数据类服务商。在数据处理和分析领域,团队服务了很多SaaS应用服务商。数据服务提供商为客户提供专利检索、法律信息检索、企业信息检索等。过去主要依赖传统查询和搜索技术(如ES等)。随着开源模型兴起,这些服务商开始基于开源模型做微调(SFT),提供更精准的数据检索服务。数据分析领域,尤其是BI(商业智能),也非常火热。虽然有些开源工具如Text2SQL,但效果不总是令人满意。企业需要投入更多人力。以腾讯为例,内部做BI分析时,基于自己的数据资源和私有SQL数据进行大量微调,在大模型上实现更精准高效的数据分析。
在细分应用场景中,有些领域直接利用大语言模型的API实现特定功能,不需要复杂微调和向量数据库结合。比如内容生成,考题生成可直接调用大模型API,人力财力投入少。HR领域,自动生成简历评估工具广泛应用,能快速分析简历内容给出评估结果,提升效率。会议和企业直播等场景,会议总结功能也帮助快速把握要点。这些场景落地相对容易,直接利用大模型能力,无需过多定制化开发,节省成本,加速产品从概念到实际应用。
来源:整理自互联网
免责声明:文中图文均来自网络,如有侵权请联系删除,心愿游戏发布此文仅为传递信息,不代表心愿游戏认同其观点或证实其描述。
相关文章
更多-
- Midjourney V7波西米亚风格提示词 AI绘画创作指南
- 时间:2026-07-25
-
- AI绘画提示词从入门到精通:手把手教你写出优质提示词
- 时间:2026-07-25
-
- 手把手搭建n8n+Deepseek智能工作流保姆级教程
- 时间:2026-07-25
-
- DeepSeek使用指南:5个实用提示词公式
- 时间:2026-07-25
-
- Midjourney V7正式发布,AI生图神器言出法随
- 时间:2026-07-25
-
- AI绘画提示词7个镜头视角制作短视频大片
- 时间:2026-07-25
-
- AI+设计如何帮企业降本增效
- 时间:2026-07-25
-
- 湖南创新AI心理助手小雅助力妇幼心理健康
- 时间:2026-07-25
精选合集
更多大家都在玩
热门话题
大家都在看
更多-
- iOS 13.5.1电池续航差是电池耗电问题吗
- 时间:2026-07-25
-
- 苹果教育优惠开启 附购买攻略
- 时间:2026-07-25
-
- 苹果iOS 14 beta 2 测试版主要更新内容:除细节变化外修复多项Bug
- 时间:2026-07-25
-
- iOS 14 beta 2 是否解决内存占用过多问题?
- 时间:2026-07-25
-
- 受欢迎的奥特曼游戏有哪些
- 时间:2026-07-25
-
- iOS 14信息应用5大更新变化
- 时间:2026-07-25
-
- iOS 14正式版上线时间公布 官方全新介绍
- 时间:2026-07-25
-
- 最新苹果iOS 14 Beta 2版本更新内容全解析与升级教程
- 时间:2026-07-25





