当前位置:   article > 正文

chatglm 130B:两个主要的稳定训练方法_chatglm13使用

chatglm13使用

在这里插入图片描述
解决方案:Qk转置的时候先用单精度来算,softmax的时候再转成FP16
在这里插入图片描述

在这里插入图片描述
在这里插入图片描述

在这里插入图片描述
第二个:embeddding 层梯度存在
在这里插入图片描述
在这里插入图片描述
emdedding层的梯度跟其它层的梯度表示范围相差的非常大,然后会导致这个对损失函数的这个缩放有一定的影响,为了解决这个问题,是直接用一种手动调整的方式,把梯度的范围调整到不影响loss的这样的一个区间上
在这里插入图片描述
在这里插入图片描述

声明:本文内容由网友自发贡献,不代表【wpsshop博客】立场,版权归原作者所有,本站不承担相应法律责任。如您发现有侵权的内容,请联系我们。转载请注明出处:https://www.wpsshop.cn/w/Monodyee/article/detail/358038
推荐阅读
相关标签
  

闽ICP备14008679号