12
0
写了 37225 字,被 2 人关注,获得了 2 个喜欢
转载自| 新智元 【导读】换个优化器,计算量少一半。 自Google提出Vision Transformer(ViT)以来,ViT渐渐成为许多视觉任务的默认backbone。...
写了 343867 字,被 267 人关注,获得了 666 个喜欢
关键词:LLaMA,Transformer,GLU,SwiGLU 前言 SwiGLU激活函数在PaLM,LLaMA等大模型中有广泛应用,在大部分测评中相较于Transform...
写了 764 字,被 56188 人关注,获得了 371 个喜欢
写了 650813 字,被 70389 人关注,获得了 136966 个喜欢
写了 949824 字,被 50250 人关注,获得了 94174 个喜欢
写了 2020161 字,被 72882 人关注,获得了 233333 个喜欢
写了 437054 字,被 68143 人关注,获得了 118756 个喜欢
写了 4697323 字,被 56632 人关注,获得了 108800 个喜欢
写了 4121600 字,被 121410 人关注,获得了 5204 个喜欢
写了 2590268 字,被 70356 人关注,获得了 177881 个喜欢
写了 0 字,被 120793 人关注,获得了 11952 个喜欢
写了 0 字,被 643144 人关注,获得了 74460 个喜欢