网上流出来的梁文锋5月20日和投资者交流会内容,其中谈中美AI上差距这一部分,梁文锋谈了自己的理解,他认为中美最大的差距不是人才,而是在算力资源上。
因为他觉得人才其实也是基于算力资源培养出来的,有足够的算力资源才能做更多的事情,也才能够在做这些事情的时候培养出人才。
这也说明了美国通过芯片制造产能卡中国的脖子,在当前总体是成功的,
但是另一方面,也迫使中国的研究人员在算法工程上进行改进,在有限的算力资源上训练出高水平的模型。
但总体而言,如果没有足够的算力,就无法训练出更大规模的模型,deepseek迫切需要更多的算力资源。他说目前国内的模型激活值(这个不是说模型本身的参数量,是指激活的部分)最大的也就是几十个B,但是国外最大可以到800B参数了,差了一个数量级。
而且还提到其实AI的投入,人才的工资并不是大头,哪怕听到顶尖AI人才一亿美元的薪资,总体算下来人力成本也远比不上算力的投资,算力的投资才是大头
我觉得这段讲话多看几遍,就越能理解未来华为和中芯国际领衔彻底突破中国芯片制造产能瓶颈的重大意义,中国的科技发展将会迎来又一个高潮。
梁文锋具体是这么说的:
”我们跟美国的差距主要在资源上面,然后人上面差距不是很大的。人上面几乎没有差距......
最聪明的那些人,可能不是说一半多一点去国外的,但有一半少一点留在国内。国内人才是不缺的,而且我们的基数大,我们每年有那么多人的补充。
人才不是瓶颈,资源是最大的瓶颈。资源首先影响到人才培养,因为算力少,我们能做的实验机会比较少,所以我们的人才整体上比美国有差距。人才的差距,本质上也是因为算力的差距。”
“在现在最大的模型上,我们其实训不起的。我们哪怕把五百亿全花掉,其实也训不起。哪怕能堆起来也用不起。现在最大的模型,它激活大概是八百B;
国内的话,我们还在几十B的这个规模,国内最大模型可能就几十B激活,那么差一个数量级。
如果我要训练跟AI同样大的模型,应该需要五万张GB300,或者华为950,二十万卡。这只是训练,还没有考虑做研究。
我们现在的资源,以及我们今年之内、接下来几个月的资源,也只足够我们在十B激活的这个规模里面去做更多的实验。因为我在几十B激活的这个规模里面,还有很多实验要做,还有很多事情需要搞清楚的。我们应该离能够训八百B的模型还比较远,时间还非常多,没有那么多卡。"
"所以我们跟美国的区别,我认为就是资源上的区别。我们可能会认为,我们看到的所有区别,包括人才的区别、模型能力的区别、应用的区别,可以认为都是因为算力资源上的区别。
算力资源一方面是国内本身卡就买不到,另外一方面是我们的资本投入比美国要少。我们在资本投入层面上少了很多,基于人才的工资在这里面占的比重是很低的。你看他们开的薪水一个亿美金这种,但算起来,人才的薪水还是占比很少,大头还是算力。
这个问题目前基本上无解,因为华为的产量也是有限的。因为我要训八百B的话,我就得二十万张华为最新的卡,这只是训练,还没有考虑做研究。
所以我们现在根本就不会考虑,到这么大的一个规模上去跟美国竞争。我们现在,还是在我们能够训练得起、能够用得起的规模上,就几十B激活的规模上要先把它做好。再等下一步有更多的资源的时候,再把它做到一百五十B、一百五十六B,或者两百五十B激活的这个规模。
所以我们跟美国在这里面有一个目前看起来很难弥补的差距。你要硬要训那么大模型也是能训,但是你没法做充分的研究。就是你在训之前,没法做充分的研究。”
我觉得可以看出来,一旦中国在半导体制造上彻底突破,那就可以提供海量的算力资源,如果再加上制造成本的下降,到时候受到压制的国产大模型还会迎来又一轮的技术井喷。
对此我保持很乐观。