为何各种类脑计算的芯片或算法,最后都会输给 Transformer架构? 我认为,是不是因为 Scale Up的架构,使得Transformer可以堆叠到 1TB参数量,从而构建出符合 CAS复杂适应系统的架构,从而在内部出现 涌现。也就是说 Transformer模型在内部会涌现出各种精妙的 隐性的结构 来适应学习压力环境。 ===
为何各种类脑计算的芯片或算法,最后都会输给 Transformer架构? 我认为,是不是因为 Scale Up的架构,使得Transformer可以堆叠到 1TB参数量,从而构建出符合 CAS复杂适应系统的架构,从而在内部出现 涌现。也就是说 Transformer模型在内部会涌现出各种精妙的 隐性的结构 来适应学习压力环境。 ===