腾讯PCG自研高性能大语言模型推理引擎「一念LLM」正式开源

AIGC动态2年前 (2024)发布机器之心

AIGC动态欢迎阅读

原标题：腾讯PCG自研高性能大语言模型推理引擎「一念LLM」正式开源
关键字：华为,算子,腾讯,显存,模型
文章来源：机器之心
内容字数：16971字

内容摘要：

AIxiv专栏是机器之心发布学术、技术内容的栏目。过去数年，机器之心AIxiv专栏接收报道了2000多篇内容，覆盖全球各大高校与企业的顶级实验室，有效促进了学术交流与传播。如果您有优秀的工作想要分享，欢迎投稿或者联系报道。投稿邮箱：liyazhou@jiqizhixin.com；zhaoyunfeng@jiqizhixin.com
本文作者袁镱博士是腾讯公司专家工程师，负责无量系统和一念LLM等机器学习训练和推理框架研发。
以 OpenAI 的 GPT 系列模型为代表的大语言模型（LLM）掀起了新一轮 AI 应用浪潮，但是 LLM 推理的高昂成本一直困扰着业务团队。
腾讯 PCG 机器学习平台中心自研了高性能 LLM 推理引擎：一念 LLM。在传统的算子融合，ContinousBatching 等推理加速技术的基础上，通过显存优化，异步调度和计算复用等技术，在相同精度的推理中，一念 LLM 相比 vLLM，TensorRT-LLM 等著名开源框架的推理单价低 20%+。
另外，为了应对国外高端 GPU 卡供应不足的问题，一念 LLM 在高性能 LLM 推理框架领域第一次同时支持 Nvi

原文链接：腾讯PCG自研高性能大语言模型推理引擎「一念LLM」正式开源