腾讯微信AI团队公布WeLM模型家族新扩展方法,采用Hidden Decoding技术训练80B和617B模型
本文是 24TopNews 对公开财经信息完成重复合并后的事件分析,不是原始采访或证券推荐。
腾讯微信人工智能团队公布了其WeLM模型家族的新扩展方法。该团队采用名为“隐藏解码”(Hidden Decoding)的技术,训练了WeLM-HD4-80B和WeLM-HD4-617B两个模型。该方法在不增加主Transformer主干的情况下,将每个词元扩展为多个内部计算流。其中,80B模型激活30亿参数,617B模型激活230亿参数。
在团队测试中,两个模型在九个共享基准测试中的表现均优于其对应的自回归基线模型。训练成本方面,80B模型的训练成本为基线的5.1倍,617B模型的训练成本为基线的4.4倍。