很多朋友不知道【摩尔线程发布TensorFlow-MUSA v1.5:加速搜广推模型训推】,今天小绿就为大家解答一下。
搜广推业务通常需要处理海量用户行为数据和大规模稀疏特征,其计算特点与视觉、语音等常见AI任务存在较大区别。一方面,Embedding参数规模较大,模型结构也需要频繁迭代;另一方面,训练阶段需要较高的吞吐能力和分布式计算能力,而在线推理又对延迟和吞吐提出较高要求。由于训练和推理往往需要共用模型代码及工程链路,因此AI框架不仅需要具备较为完整的算子支持,还需要兼顾混合精度和分布式计算能力。 【CNMO科技消息】8月21日消息,摩尔线程正式发布TensorFlow-MUSA v1.5.0。作为面向MUSA统一系统架构GPU推出的TensorFlow插件,该版本进一步完善了对搜索、广告、推荐(以下简称“搜广推”)业务的支持,开发者可以在摩尔线程全功能GPU上直接开展AI模型训练与推理,无需对原有TensorFlow模型代码进行大幅修改。此次更新还针对搜广推业务的模型特点进行了专项优化,并已在GitHub开源,同时提供预构建镜像,方便开发者快速部署。
相关信息 此外,TensorFlow-MUSA v1.5还针对近年来出现的新型搜广推架构进行了适配,支持EDCN、DCNmix、Wukong、RankMixer、OneTrans和TokenMixerLarge等模型。摩尔线程表示,这些模型覆盖了从传统推荐算法到新型模型架构的多个应用场景,可以满足开发者在不同搜广推业务中的训练和推理需求。 性能方面,摩尔线程公布的实验室测试数据显示,基于AI训推一体智算卡MTT S5000运行搜广推模型时,在BF16、TF32等数据精度以及多流执行、算子融合、图优化和XLA编译优化等能力支持下,部分模型表现出较明显的性能提升。以TokenMixerLarge为例,单步训练耗时为138.048ms,相较国际主流GPU的加速比达到1.81倍。摩尔线程同时给出的整体测试结果显示,部分前沿搜广推模型训练吞吐提升幅度达到1.5倍至1.85倍。不过,官方也注明,相关数据来自摩尔线程实验室,实际性能会受到模型实现、硬件配置、软件版本以及训练参数等因素影响。 在模型兼容性方面,TensorFlow-MUSA v1.5覆盖范围进一步扩大。该版本不仅继续支持ResNet等经典视觉、语音模型,还加入了大量搜广推模型,包括Wide&Deep、FNN、PNN、DeepFM、NFM、MLR、SharedBottom等经典模型,以及DCN、xDeepFM、AutoInt、FGCNN、FiBiNet、FWFM等特征交叉模型。同时,针对用户行为序列建模和多任务学习场景,该版本支持DIN、DIEN、DSIN、BST、MMoE、ESMM、PLE等模型。
摩尔线程版权所有,未经许可不得转载 目前,TensorFlow-MUSA v1.5.0已经在GitHub开源,开发者可以按照官方说明自行编译安装,也可以直接使用预构建镜像。此次版本更新将重点从通用模型支持进一步延伸至搜广推等高计算需求场景,摩尔线程也在通过框架适配、模型覆盖和性能优化等方式,完善MUSA GPU的软件生态。 软件版本方面,TensorFlow-MUSA v1.5支持TensorFlow 2.6.1和2.15.1,并可配合MUSA SDK 4.3.5或5.1.0使用。摩尔线程表示,考虑到TensorFlow 2.15.1之后的功能变化相对有限,同时部分早期特性被移除,后续将主要维护TensorFlow 2.15.1版本,并保持前向兼容,同时根据开发者需求评估其他版本的支持。 针对这些需求,TensorFlow-MUSA v1.5.0在框架层面实现了对TensorFlow数据流图、自动微分以及分布式训练等核心机制的支持,并将MUSA设备作为TensorFlow原生设备进行注册。对于原本基于TensorFlow开发的搜广推模型而言,可以继续沿用原有开发方式,将模型迁移至摩尔线程全功能GPU上运行,从而降低适配过程中需要进行的代码和工程调整。
以上问题已经回答了。如果你想了解更多,请关新经网网站 (https://www.xinhuatone.com/)
摩尔线程发布TensorFlow-MUSA v1.5:加速搜广推模型训推
2026-08-21 20:40:21 来源:新经网 作者:冯思韵
郑重声明:本文版权归原作者所有,转载文章仅为传播更多信息之目的,如作者信息标记有误,请第一时间联系我们修改或删除,多谢。
