兴趣内容
相关好价
全部产品
精选
最新
MoE大模型大火,AI厂商们在新架构上看到了什么样的未来?
文 | 智能相对论作者 | 陈泊丞很久以前,在一个遥远的国度里,国王决定建造一座宏伟的宫殿,以展示国家的繁荣和权力。他邀请了全国最著名的建筑师来设计这座宫殿,这个人以其卓越的才能和智慧闻名。然而,这位建筑师设计的宫殿虽然精美绝伦,却因为过于复杂和精细,以至于在实际施工过程中遇到了重重困难,许多技艺高超的工匠也感到力不从心。这时,国王手下有三位普通的石匠,他们虽然没有显赫的名声,技艺也称不上顶尖,但三人经常一起工作,彼此间有着极好的默契和互补的技能。面对宫殿建设的难题,他们没有退缩,而是聚在一起讨论和思考解决方案。通过无数次的尝试和调整,他们发明了几种新的工具和施工方法,简化了复杂的建筑过程,使原本难以实施的设计变得可行。最终,这三位平平无奇的石匠通过配合,不仅帮助解决了工程上的难题,还加快了宫殿的建设进度,确保了工程质量,让国王和所有人大为惊讶。他们的故事很快传遍了整个国度,并成了一段佳话——“众人智慧胜过一人天才”。而这句佳话所反映出来的道理,恰恰正是目前AI行业大火的MoE混合专家模型的设计思路。目前,随着MoE模型大火,AI大模型的发展不再是追求“一人天才”,而是走向了“众人智慧”。主流厂商越来越看重MoE模型,在新架构上他们又看到了什么样的未来?“众人智慧胜过一人天才”的佳话是否能在MoE模型上得以实现?有多少大模型厂商在押注“众人智慧”?目前,在海外,OpenAI的GPT-4、谷歌的Gemini、Mistral AI的Mistral、xAI的Grok-1等主流大模型都采用了MoE架构。而在国内,昆仑万维推出的天工3.0、浪潮信息发布的源2.0-M32、通义千问团队发布的Qwen1.5-MoE-A2.7B、MiniMax全量发布的abab6、幻方量化旗下的DeepSeek发布的DeepSeek-MoE 16B等等也都属于MoE模型。越来越多的厂商开始涉足MoE模型的开发和应用。比起“众人智慧”,MoE模型的具体工作原理更接近中国的一句古语“术业有专攻”,通过把任务分门别类,然后分给多个特定的“专家”进行解决。它的工作流程大致如此,首先数据会被分割为多个区块(token),然后通过门控网络技术(Gating Network)再把每组数据分配到特定的专家模型(Experts)进行处理,也就是让专业的人处理专业的事,最终汇总所有专家的处理结果,根据关联性加权输出答案。当然,这只是一个大致的思路,关于门控网络的位置、模型、专家数量、以及MoE与Transformer架构的具体结合方案,各家方案都不尽相同,也逐渐成为各家竞争的方向——谁的算法更优,便能在这个流程上拉开MoE模型之间的差距。像浪潮信息就提出了基于注意力机制的门控网络(Attention Router),这种算法结构的亮点在于可以通过局部过滤增强的注意力机制(LFA, Localized Filtering-based Attention),率先学习相邻词之间的关联性,然后再计算全局关联性的方法,能够更好地学习到自然语言的局部和全局的语言特征,对于自然语言的关联语义理解更准确,从而更好地匹配专家模型,保证了专家之间协同处理数据的水平,促使模型精度得以提升。基于注意力机制的门控网络(Attention Router抛开目前各家厂商在算法结构上的创新与优化不谈,MoE模型这种工作思路本身所带来的性能提升就非常显著——通过细粒度的数据分割和专家匹配,从而实现了更高的专家专业化和知识覆盖。这使得MoE模型在处理处理复杂任务时能够更准确地捕捉和利用相关知识,提高了模型的性能和适用范围。因此,「智能相对论」尝试了去体验天工3.0加持的AI搜索,就发现对于用户较为笼统的问题,AI居然可以快速的完成拆解,并给出多个项目参数的详细对比,属实是强大。天工AI搜索提问“对比一下小米su7和特斯拉model3”所得出的结果由此我们可以看到,AI在对比两款车型的过程中,巧妙地将这一问题拆解成了续航里程、动力性能、外观设计、内饰设计、智能化与自动驾驶、市场表现与用户口碑、价格等多个项目,分别处理得出较为完整且专业的答案。这种“众人智慧”的结果,更是“术业有专攻”的优势——MoE模型之所以受到越来越多厂商的关注,首要的关键就在于其所带来的全新解决问题的思路促使模型的性能得到了较为显著的提高。特别是伴随着行业复杂问题的涌现,这一优势将使得MoE模型得到更广泛的应用。各大厂商争先开源MoE模型的背后在MoE模型被广泛应用的同时,也有部分厂商争先开源了自家的MoE模型。前不久,昆仑万维宣布开源2千亿参数的Skywork-MoE。而在此之前,浪潮信息的源2.0-M32、DeepSeek的DeepSeek-MoE 16B等,也都纷纷开源。开源的意义在于让MoE模型更好的普及。那么,对于市场而言,为什么要选择MoE模型?抛开性能来说,MoE模型更突出的一点优势则在于算力效率的提升。DeepSeek-MoE 16B在保持与7B参数规模模型相当的性能的同时,只需要大约40%的计算量。而37亿参数的源2.0-M32在取得与700亿参数LLaMA3相当性能水平的同时,所消耗的算力也仅为LLaMA3的1/19。也就意味着,同样的智能水平,MoE模型可以用更少的计算量和内存需求来实现。这得益于MoE模型在应用中并非要完全激活所有专家网络,而只需要激活部分专家网络就可以解决相关问题,很好避免了过去“杀鸡用牛刀”的尴尬局面。举个例子,尽管DeepSeek-MoE 16B的总参数量为16.4B,但每次推理只激活约2.8B的参数。与此同时,它的部署成本较低,可以在单卡40G GPU上进行部署,这使得它在实际应用中更加轻量化、灵活且经济。在当前算力资源越来越紧张的局面下,MoE模型的出现和应用可以说为行业提供了一个较为现实且理想的解决方案。更值得一提的是,MoE模型还可以轻松扩展到成百上千个专家,使得模型容量极大增加,同时也允许在大型分布式系统上进行并行计算。由于各个专家只负责一部分数据处理,因此在保持模型性能的同时,又能显著降低了单个节点的内存和计算需求。如此一来,AI能力的普惠便有了非常可行的路径。这样的特性再加上厂商开源,将促使更多中小企业不需要重复投入大模型研发以及花费过多算力资源的情况下便能接入AI大模型,获取相关的AI能力,促进技术普及和行业创新。当然,在这个过程中,MoE模型厂商们在为市场提供开源技术的同时,也有机会吸引更多企业转化成为付费用户,进而走通商业化路径。毕竟,MoE模型的优势摆在眼前,接下来或许将有更多的企业斗都会尝试新的架构来拓展AI能力,越早开源越能吸引更多市场主体接触并参与其中。开源本身是对行业趋势的一种认知判断和提前布局,由此来说MoE模型具有成为未来AI能力普惠的关键。写在最后MoE大模型作为当前人工智能领域的技术热点,其独特的架构和卓越的性能为人工智能的发展带来了新的机遇。不管是应用还是开源,随着技术的不断进步和应用场景的不断拓展,MoE大模型有望在更多领域发挥巨大的潜力。如同开篇的寓言故事,人们或许会在开始追求惊才艳艳的“一人天才”,但是在实践过程中也会逐渐发现懂得配合和互补的“众人智慧”才是建造落地的关键,就如同现在AI领域的MoE大模型大火。*本文图片均来源于网络此内容为【智能相对论】原创,仅代表个人观点,未经授权,任何人不得以任何方式使用,包括转载、摘编、复制或建立镜像。部分图片来自网络,且未核实版权归属,不作为商业用途,如有侵犯,请作者与我们联系。•AI产业新媒体;•澎湃新闻科技榜单月度top5;•文章长期“霸占”钛媒体热门文章排行榜TOP10;•著有《人工智能 十万个为什么》•【重点关注领域】智能家电(含白电、黑电、智能手机、无人机等AIoT设备)、智能驾驶、AI+医疗、机器人、物联网、AI+金融、AI+教育、AR/VR、云计算、开发者以及背后的芯片、算法等。  
采访柴田启子:我喜欢那些有缺点的角色
日本超人气绘本作家柴田启子又有新书出版了!这次,是她获得第16回MOE绘本屋大赏第三名,超级欢乐也超级治愈的绘本《熊猫平底锅》。(棒棒堂微店和小红书从今天起参与首发一周哈,文末有购买通道。)《熊猫平底锅》讲述了对料理失去兴趣的熊主厨,遇到一个会把普通料理变成美味无比的熊猫料理的小熊猫勺子,从而发现让食物变得美味的秘密……这是一个把童心、魔法和善意揉进美食里的故事,就像一块加入了天然酵母的面团,有着自我生长的弹性和芬芳的气息。故事很好玩,主角很可爱,期间还有一段魔咒舞蹈助兴(被我女儿形容为舞姿很像科目三)。熊猫勺勺教酷酷熊主厨的魔咒舞,让我想起了小木屋工坊的《我救了一只大王乌贼》,话说日本绘本中的魔性舞蹈真是不少~但我更喜欢绘本里对「美味」的理解。人们常说,是爱让一道普通的菜变得美味,但这句话会不会变成对主妇妈妈的压力呢?光有爱,缺乏发自内心的快乐,怎么可能做出美味的饭菜?从这个角度说,柴田启子不仅懂美食,更懂人性的关怀。在日本,柴田启子是和吉竹伸介齐名的人气绘本作家。去年年底的第16回MOE绘本屋大赏,她以两部作品分获第一名和第三名的成绩,打破了吉竹伸介多年来「霸榜」的格局。而她的「出道」,也和吉竹伸介颇为类似:43岁那年,为了鼓励弱视的儿子“戴眼镜也很酷”,而创作了绘本《眼镜猫》,从此走上绘本作家之路,并迅速大红。迄今她已出版了30本绘本,拿遍日本各大绘本奖项。2020年出版的《神秘面包小子》(即《面包小偷》),是柴田启子最具人气的代表作。这个系列迄今已经出版了5本,在日本总发行数量接近200万册。MOE杂志介柴田启子作品的内页在绘本杂志MOE2023年9月柴田启子专辑里,编辑部归纳了柴田启子作品的关键词,比如,令人忍俊不禁的表情,可爱丰富的拟声词,各种让人爆笑的“名场面”,日常与想象的微妙平衡,能引起普通人共鸣的幸福感……《猫咪列车》(海豚传媒引进)内页她会在画面包小子觉得难吃的画面时,自己也把脸缩成一团;画人物说话时,一个人自言自语;画白熊这个吃货的时候,肚子也是咕咕叫。《神秘面包小子》(湖南少年儿童出版社引进)内页而在另一面,柴田启子也是一个活得有声有色的人。她是两个男孩的妈妈,两只猫的主人,面包、咖喱饭、蛋包饭的爱好者,日本单口相声「落语」的追随者。在创作绘本之余,还经营着一家线上手工品店「柴田商店」,设计文具、明信片,和丈夫合作制作木头人偶。MOE杂志介柴田启子手工作品的内页「我并没有想过成为专门创作绘本的人,只是纯粹地喜欢创作这件事,绘本只是我表达自我的其中一种方式。只要我自己觉得有趣的事情,都会去尝试做做看。」我对柴田启子的喜欢和好奇,不仅来自她的作品,也来自她这个人。于是,借着《熊猫平底锅》的出版,在蒲蒲兰的帮助下,我书面采访了柴田启子。虽然采访提纲中列出的很多我非常关注的问题,比如她对幽默的态度,和乔恩·克拉森、长新太、长谷川义史等其他人幽默的对比等,因为各种原因没有收到回复;不过,从她简单的只言片语中,还是可以一窥一个鲜活、真诚的人。没关系,她的创作之路还很长,我等待更有缘分的访谈。小巷: 首先恭喜你在第16回MOE绘本屋大赏中,有两部作品分别获得第一名和第三名;同时,你的面包小偷系列销售突破百万,周边延伸产品也大受欢迎。您觉得您的作品到底「戳中」读者什么呢?柴田启子: 到底戳中读者什么,我还没考虑过这个问题,受到大家如此欢迎我也很意外,可能是作品中那些离奇的元素让大家觉得有趣吧!小巷: 2023年9月MOE杂志,您把笔下所有的角色画在了一起,如果要您选择一个最像您自己的角色,会是谁呢?柴田启子: 眼镜猫。今后的创作,也会在眼镜猫上做延伸。小巷:  您作品里的主角,近视的猫,偷面包的老鼠,懒到爆炸的树懒,手拙的企鹅……都是「有缺陷又可爱」的类型,为什么会如此喜欢有着小毛病的角色?柴田启子: 比起完美的人,有缺点的人更有个性,更富有魅力。在创作绘本角色时,我赋予了他们我喜欢的人物性格。小巷: 听说您很喜欢落语,《熊猫平底锅》中熊猫勺勺的咒语就来源于一段落语。您作品中的幽默,故事的转折等,是不是也受到落语的影响和启发?柴田启子: 落语家能想象出很多的角色,这很了不起,他们有丰富的内心感受,最后的「结尾」也总能让人心情畅快,我希望能用绘本表现这些。落语表演,图片来自网络小巷: 我在您的很多作品里能够读到幸福感,比如熊猫勺勺说「快乐了才能做出好吃的饭菜」,躺在蛋包饭里一脸惬意的小白熊等等,是不是因为您本人也是很喜欢吃美食的人?柴田启子: 可能我自己在吃东西时感受到了幸福,所以在作品中自然流露了出来,但不会有意识地去营造。小巷: 听说《面包小偷》中的面包店就是你平时经常会逛的面包店chimney,不知道其他作品里的食物或场景都有原型吗?柴田启子: 如果绘画需要的话,会去实地看看,但并不总去。小巷: 日本的美食绘本非常丰富,不仅有写实性、呈现食物制作过程的写真绘本,也有严肃讨论吃和生存的绘本(比如田岛征三去年新作《吃吃吃》);当然更多是把食物拟人化为主角的作品。您如何看待食物与人的关系?柴田启子: 食物对人来说是一个美丽的存在,关乎生命,是生活中非常重要的部分。我想以自己的方式在绘本中愉快地呈现食物,如果能引起读者对食物的关注就更好了。小巷:  您有很多系列作品,面包小偷已经出了第五本,熊猫平底锅即将出版第二本,小白熊有四本;能够就一个主角持续创作,一方面证明它很受欢迎,但从创作者的角度而言,会不会有一些重复?创作系列绘本的难度在哪里,您又是如何完成它们?柴田启子: 我希望系列书的新作,要比之前的有趣。虽然部分情节是有模式的,但还是努力让故事有新的突破和展开,这是一个不断试错的过程。小巷: 在绘本创作之外,您还经营着一家线上杂货铺,同时也会做一些策展。做设计、做手工等工作,与创作绘本有何区别?两者又有什么互相助力的作用?柴田启子: 和其他工作相比,创作绘本可以自由表达,不受任何限制,这非常宝贵。而个展等其他工作能给我带来创作的灵感,算是重要的创作启动环节。只要体力允许,今后仍会“身兼多职”,希望能在海外办个展。MOE杂志介柴田启子的工作室小巷: 《面包小偷》系列第一本引进到中国时,出版社把书名处理成了《神秘面包小子》,可能也是担心偷面包这件事给孩子带来的负面影响。您为什么要塑造一个偷面包的主角?在塑造角色和考虑故事的时候,您会注意哪些事情呢,或者有哪些画面是你不想画的呢?柴田启子: 大人骂孩子、伤害孩子之类的场景我不会画。小巷:  听说《熊猫平底锅》是一个在厨房做饭时想出来的故事。不少女性作家把厨房经验转化成文学艺术创作的灵感,这个情况在成人文学和儿童绘本中都有。您是如何看待创作和家务育儿的呢?柴田启子: 我不认为要严格按育儿书上写的方法养育孩子,如果自己忙不过来,就让家人帮忙,如果家人也忙的话,就利用地区的一些服务实施,总会有办法的。偷点懒也没什么,只要发自心底地爱孩子就可以。- e n d -号外!《熊猫平底锅》在绘本棒棒堂的微店和小红书(搜索:绘本棒棒堂小巷)都已经上架了,首发一周。原价42元,我们5折21元包邮。内容简介 酷酷熊厨师最近不太喜欢做饭,餐厅的生意也变得很差了。有一天,他在买锅的时候,遇见一家熊猫工具店。店主送给他一个熊猫形状的煎锅,打开锅盖,里面有一个小熊猫勺子。勺勺教给酷酷熊主厨一个咒语,念着咒语,普通的菜肴顿时变成了美味无比的熊猫菜。然而,有一个必须遵守的承诺……▼我是小巷,学的是历史和女性文学,当了妈妈后从文学爱好者变成绘本爱好者。采访过100位世界童书人,策划出版了《爱讲故事的爸爸是最好的爸爸》。我相信,好的绘本既不是给孩子也不是给大人,而是给人类读的。**改版,请亲爱的大家一定记得星标关注我们,这样才能不错过推送,以及我们精心准备的封面图哦! 点击阅读原文直达购买页面           
晋升业内新宠儿,MoE模型给了AI行业两条关键出路
文 | 智能相对论作者 | 陈泊丞今年以来,MoE模型成了AI行业的新宠儿。一方面,越来越多的厂商在自家的闭源模型上采用了MoE架构。在海外,OpenAI的GPT-4、谷歌的Gemini、Mistral AI的Mistral、xAI的Grok-1等主流大模型都采用了MoE架构。而在国内,昆仑万维推出的天工3.0、浪潮信息发布的源2.0-M32、通义千问团队发布的Qwen1.5-MoE-A2.7B、MiniMax全量发布的abab6、幻方量化旗下的DeepSeek发布的DeepSeek-MoE 16B等等也都属于MoE模型。另一方面,在MoE模型被广泛应用的同时,也有部分厂商争先开源了自家的MoE模型。前不久,昆仑万维宣布开源2千亿参数的Skywork-MoE。而在此之前,浪潮信息的源2.0-M32、DeepSeek的DeepSeek-MoE 16B等,也都纷纷开源。为什么MoE模型如此火爆,备受各大厂商的青睐?在开源的背后,MoE模型又是以什么样的优势使各大主流厂商成为其拥趸,试图作为改变AI行业的利器?MoE模型火爆的背后:全新的AI解题思路客观来说,MoE模型的具体工作原理更接近中国的一句古语“术业有专攻”,通过把任务分门别类,然后分给多个特定的“专家”进行解决。它的工作流程大致如此,首先数据会被分割为多个区块(token),然后通过门控网络技术(Gating Network)再把每组数据分配到特定的专家模型(Experts)进行处理,也就是让专业的人处理专业的事,最终汇总所有专家的处理结果,根据关联性加权输出答案。当然,这只是一个大致的思路,关于门控网络的位置、模型、专家数量、以及MoE与Transformer架构的具体结合方案,各家方案都不尽相同,也逐渐成为各家竞争的方向——谁的算法更优,便能在这个流程上拉开MoE模型之间的差距。像浪潮信息就提出了基于注意力机制的门控网络(Attention Router),这种算法结构的亮点在于可以通过局部过滤增强的注意力机制(LFA, Localized Filtering-based Attention),率先学习相邻词之间的关联性,然后再计算全局关联性的方法,能够更好地学习到自然语言的局部和全局的语言特征,对于自然语言的关联语义理解更准确,从而更好地匹配专家模型,保证了专家之间协同处理数据的水平,促使模型精度得以提升。基于注意力机制的门控网络(Attention Router)抛开目前各家厂商在算法结构上的创新与优化不谈,MoE模型这种工作思路本身所带来的性能提升就非常显著——通过细粒度的数据分割和专家匹配,从而实现了更高的专家专业化和知识覆盖。这使得MoE模型在处理处理复杂任务时能够更准确地捕捉和利用相关知识,提高了模型的性能和适用范围。因此,「智能相对论」尝试了去体验天工3.0加持的AI搜索,就发现对于用户较为笼统的问题,AI居然可以快速的完成拆解,并给出多个项目参数的详细对比,属实是强大。天工AI搜索提问“对比一下小米su7和特斯拉model3”所得出的结果由此我们可以看到,AI在对比两款车型的过程中,巧妙地将这一问题拆解成了续航里程、动力性能、外观设计、内饰设计、智能化与自动驾驶、市场表现与用户口碑、价格等多个项目,分别处理得出较为完整且专业的答案。这便是“术业有专攻”的优势——MoE模型之所以受到越来越多厂商的关注,首要的关键就在于其所带来的全新解决问题的思路促使模型的性能得到了较为显著的提高。特别是伴随着行业复杂问题的涌现,这一优势将使得MoE模型得到更广泛的应用。各大厂商争先开源MoE模型:解决AI算力荒的另一条路径开源的意义在于让MoE模型更好的普及。那么,对于市场而言,为什么要选择MoE模型?抛开性能来说,MoE模型更突出的一点优势则在于算力效率的提升。DeepSeek-MoE 16B在保持与7B参数规模模型相当的性能的同时,只需要大约40%的计算量。而37亿参数的源2.0-M32在取得与700亿参数LLaMA3相当性能水平的同时,所消耗的算力也仅为LLaMA3的1/19。也就意味着,同样的智能水平,MoE模型可以用更少的计算量和内存需求来实现。这得益于MoE模型在应用中并非要完全激活所有专家网络,而只需要激活部分专家网络就可以解决相关问题,很好避免了过去“杀鸡用牛刀”的尴尬局面。举个例子,尽管DeepSeek-MoE 16B的总参数量为16.4B,但每次推理只激活约2.8B的参数。与此同时,它的部署成本较低,可以在单卡40G GPU上进行部署,这使得它在实际应用中更加轻量化、灵活且经济。在当前算力资源越来越紧张的“算力荒”局面下,MoE模型的出现和应用可以说为行业提供了一个较为现实且理想的解决方案。更值得一提的是,MoE模型还可以轻松扩展到成百上千个专家,使得模型容量极大增加,同时也允许在大型分布式系统上进行并行计算。由于各个专家只负责一部分数据处理,因此在保持模型性能的同时,又能显著降低了单个节点的内存和计算需求。如此一来,AI能力的普惠便有了非常可行的路径。这样的特性再加上厂商开源,将促使更多中小企业不需要重复投入大模型研发以及花费过多算力资源的情况下便能接入AI大模型,获取相关的AI能力,促进技术普及和行业创新。当然,在这个过程中,MoE模型厂商们在为市场提供开源技术的同时,也有机会吸引更多企业转化成为付费用户,进而走通商业化路径。毕竟,MoE模型的优势摆在眼前,接下来或许将有更多的企业斗都会尝试新的架构来拓展AI能力,越早开源越能吸引更多市场主体接触并参与其中。但是,开源最关键的优势还是在于MoE模型对当前算力问题的解决。或许,随着MoE模型被越来越多的企业所接受并应用,行业在获得相应AI能力的同时也不必困顿于算力资源紧张的问题了。写在最后MoE大模型作为当前人工智能领域的技术热点,其独特的架构和卓越的性能为人工智能的发展带来了新的机遇。不管是应用还是开源,随着技术的不断进步和应用场景的不断拓展,MoE大模型有望在更多领域发挥巨大的潜力。MoE模型的本质在于为AI行业的发展提供了两条思路,一是解决应用上的性能问题,让AI有了更强大的解题思路。二是解决算力上的欠缺问题,让AI有了更全面的发展空间。由此来看MoE模型能成为行业各大厂商的宠儿,也是水到渠成的事情。*本文图片均来源于网络此内容为【智能相对论】原创,仅代表个人观点,未经授权,任何人不得以任何方式使用,包括转载、摘编、复制或建立镜像。部分图片来自网络,且未核实版权归属,不作为商业用途,如有侵犯,请作者与我们联系。•AI产业新媒体;•澎湃新闻科技榜单月度top5;•文章长期“霸占”钛媒体热门文章排行榜TOP10;•著有《人工智能 十万个为什么》•【重点关注领域】智能家电(含白电、黑电、智能手机、无人机等AIoT设备)、智能驾驶、AI+医疗、机器人、物联网、AI+金融、AI+教育、AR/VR、云计算、开发者以及背后的芯片、算法等。