兴趣内容
相关好价
全部产品
精选
最新
当世界上最快的GPU遇到百川大模型
前两天B站上关于世界上最快的GPU的评测火了.光是点赞数就超过了7万.但是,他们居然用这么强大的GPU来打游戏,简直是暴殄天物,这次就让我们来走一个正确的示范, 谁还没有一个Geek发烧友的朋友呢, 而且这次我们足足借用了多一倍的GPU,也就是8张80G的H100GPU(每次都想写显卡……但是这个不适合3A大作啊)。作为企业级的GPU,它最大的用武之地当然是科学计算了,当下最火的是莫过于大模型,包括ChatGPT一类的大模型,吊打一众小伙伴,对于普通用户你管这个叫普通? 来讲,自己搭建一个模型是一个非常靠谱和有趣的场景.我们就找一个大模型来测试一下这颗全球最快的GPU*8的表现。 先隆重介绍一下今天要使用的大模型,也就是所谓的基座模型:baichuan-7Bhttps://huggingface.co/baichuan-inc/baichuan-7B 按照百川的官方介绍,baichuan-7B是由百川智能开发的一个开源的大规模预训练模型。基于Transformer结构,在大约1.2万亿tokens上训练的70亿参数模型,支持中英双语,上下文窗口长度为4096。在标准的中文和英文权威benchmark(C-EVAL/MMLU)上均取得同尺寸最好的效果。同时官方也给出了使用百川7B的理由.在同尺寸模型中baichuan-7B达到了目前SOTA的水平,参考官方的MMLU指标baichuan-7B使用自有的中英文双语语料进行训练,在中文上进行优化,在C-Eval达到SOTA水平不同于LLaMA完全禁止商业使用,baichuan-7B使用更宽松的开源协议,允许用于商业目的通过评测,我们也可以看出来百川7B在目前的LLaMA的一众类似模型中的效果是最强的.基座模型的强大,特别是对中文的支持,让我们对它在中文chat的能力上很有信心,特别是大BOSS也在群里发出了向"中国xxx的口号",让大家纷纷尝试,我就在群里遇到了来自字节的大佬. 但是官方的放出的基座模型目前只支持进行续写形式的推理也是所有生成式大模型的基础形式这种形式的交互显然是没有办法让更多的小伙伴儿通过聊天的形式愉快试用的.很快就有北航的小伙伴儿放出来可以进行微调的项目,同时也给出了第一个微调的Lora模型,然后大家就可以愉快的聊天了.感兴趣的小伙伴儿可以搜索:"LLaMA-Efficient-Tuning"经过试用,我们发现似乎训练的不够充分,然后我们就请上了今天的主角,具有80G*8能力的最强GPU,基于上面的代码和数据集又训练了一个新的模型,感觉基础模型的能力非常好.这就是GPU在训练的时候的情况.作为最开始的尝试,我们只进行了4 epoch的训练, 跑通了基本的SFT微调.让模型具有了能进行聊天的能力,我们也随便问了他一些问题, 整体感觉和Vicuna13b以及Glm6b相当,但是也有一些事实上的错误. 上面的这些经典的问题中,安卓和lighting数据线算是一个经典的案例了.冥王星这里就开始所有大模型的通病,开始一本正经的胡说八道了,但是相比其他的模型,感觉有一些莫名的喜感,这个回答也很有画面感,是真的"踢".DNA的回答就是中规中矩了. 而且带着一种似是而非的错误,比如上面的第5条.总之,在基于52k的Alpaca_GPT4_cn的这个数据集的微调下,百川7B已经具有了基本的对话能力,也能回答一些问题.而由于H100的强大,整个微调在40多分钟就完成了.因此我们决定利用更大,更丰富的数据集对他进行微调,看看能发生点什么.首先这个数据集要具有基本的对话的能力,因此我们准备保留Alpaca_GPT4_cn这个数据集,它是通过和GPT4交互得到的,因此算是SFT微调中非常有代表性的基础。接着,我们又找到了instinwild_ch这个数据集,它也具有相当的数据量,大约是51K,而且根据官方的介绍,它更具有想象力和思维开阔,具有"头脑风暴"的特点,看看是不是可以给我们增加一些多样性的回答.百川在介绍中说,这个模型的数理能力不强,我们特意找到了 belle_cn_school_math 这样一个数据集,看看能不能教会它算算数,里面的案例是这样的:{'instruction': '题目:小明每天早上花费10分钟时间走到学校,如果小明家距离学校2公里,那么他每分钟走多少米?', 'input': '', 'output': '这是一个关于速度、路程、时间的数学问题。我们可以通过公式:速度=路程÷时间 来解决。n因为小明每天早上走2公里,所以他的路程为2千米。而他每天早上要花费10分钟时间走到学校,因此他的时间为10分钟,即600秒。n所以小明每分钟走的距离为 2公里 / 600秒 = 0.0033公里/秒 或 3.3米/秒。n答案:小明每分钟走3.3米。'}因为它这个数据集很大,我们也按照前面的情况,随机选择了其中的大约50K数据作为数学的数据混入到模型中.最后,我们还从张大妈的问答栏目中选择了1K的数据进行混入,整体形成了这个大约有150K的数据集,然后开始了20个epoch的微调.经过漫长的等待,就有了最终的结果:终于解决了吃苹果的问题.然后顺带解决了算术表达式的问题,以后再也不用考虑什么编译原理计算算术表达式了.虽然漏了2,但是已经比Vicuna和6B的结果要好.我下次要问问它鸡兔同笼的问题.一元一次方程没问题.这是最让我蒙圈的回答,答案没问题,理由不对.我想了一下.发现虽然是个集合问题,但是"背包旅客"的补集,所给定的集合是不同的,换句话说,"凶手",在给定的集合中, 背包客,你,x 都是真子集.最后,放上这次微调的模型结果和所用的数据集, 感兴趣的小伙伴儿可以来试试.https://huggingface.co/fireinwind/baichuan-7b-sft-v2 另外,大家有什么有趣的想法,也可以和我们一起聊聊啊.就像百川的老大王小川说的一样:一起给中国大模型生态添砖加瓦.  
世界烘焙商收录|🇨🇳百川
关于烘焙商百川为上海本土的咖啡烘焙品牌,有实体门店,定位为社区型咖啡店。品牌成立于2020年,据我了解,烘焙师之前曾经在另一家上海本土烘焙商明谦工作,后来独立出来做百川的烘焙,烘焙机器为半热风半直火烘焙机PROBAT和COFFEEPRO。豆子信息生豆产地:埃塞俄比亚·沃卡庄园/处理站:盖得步生豆种类:Heirloom海拔高度:1,993m处理方式:水洗生豆产季:2020冲煮笔记干香有非常强烈的花香味,冲煮后整体上呈酸甜调性,甜感很不错,尾韵是干净收尾的酸质。冲煮方案滤杯:凡未V60研磨:日常研磨粗细(玲珑40P 22格)水质:12L农夫山泉·千岛湖水源水温:80℃比例:1:16.25冲煮:第一段不焖蒸直接注水豆重的 10 倍水量,大约在 1 分钟左右开始注入第二段水,水量为 100g,取全段。关于冲煮方案这个低温萃取方案来自于不右小海,前段时间在不右感受了一下,确实是可以针对偏酸甜感的柔和口感调性进行萃取,我还挺喜欢的,觉得用在口粮豆上很合适,但这个萃取方案是不能把豆子所有风味进行完整萃取。不过,没有完美的萃取方案,选择自己喜欢或者合适豆子的其实就可以了。  
装修指南——月球挂钟!
网购一个新家之1·简约月球挂钟今天才收到挂钟,觉得太美腻了。感觉家里要有个时钟才方便,能够一抬头就知道时间,而不用去找手机看时间本来想买只显示数字的电子钟,但是发现那种都是要插电的,觉得影响美观,所以还是考虑挂钟·我家装修风格是现代简约,所以挑了个比较简单的,收到实物后觉得超出我的预期了这个有超多款,我买的里面月球图案很有质感,选的黑色边框与我家风格一致。最后面附了张我家客厅图,很多东西都是网购的,感觉是网购了一个家,下篇再继续分享  
2026国产大模型技术突围关键窗口期:局部领先已现,三大信号预示突破可能
2026年被视为国产AI大模型实现技术突围的关键窗口期。在政策周期、国际竞争格局与商业化临界点的多重交汇下,评估国产大模型能否在这一年实现系统性突破,不仅关乎产业走向,更直接影响企业技术选型与投资决策。当前,国产大模型已从参数军备竞赛转向效能革命与场景深耕,其技术实力、生态支撑与外部约束共同构成了判断突围可能性的核心依据。80 7201国产大模型技术能力:从追赶到局部领跑截至2026年初,国产大模  
源自223位全网作者