返回

第一百八十二章 别想了,没戏

首页
关灯
护眼
字:
上一页 回目录 下一章 进书架
    第一百八十二章 别想了,没戏 (第2/2页)

之间传输。

    每隔一段时间,还要对中间结果进行快照,防止因为偶发故障导致数据丢失。

    快照不能太频繁,太频繁会拖慢训练效率。也不能间隔太长,间隔太长的话,一旦集群故障,前面几个小时甚至几天的训练都有可能白跑。

    这里面涉及的资金需求、工程能力、集群调度、故障恢复,不是小公司能轻易负担的。

    这也是为什麽赵文渊一直说,大模型不是谁都玩得起。

    没有足够的算力,连牌桌都上不了。

    而没有足够强的工程团队,即使上了牌桌也没用,只会被自己的训练任务拖死。

    像这次源智科技和鼎盛签了合作协议,赵文渊拿到的是一个特殊设置过的帐号。

    这个帐号有鼎盛云内部权限,可以调用专门用於大模型训练的GPU集群。这种GPU集群在鼎盛云,乃至各家云服务提供商那里,根本就不是普通客户打开网页、充值余额就能买到的服务。

    有钱你也买不到。

    所以韩路一能拿到鼎盛的算力,的确是走了一条大大的捷径。

    赵文渊承认这一点,但他也很不爽,因为他们还得防着鼎盛偷标注数据。

    这一轮训练出来的汤圆,只能是「残血版」。

    最核心、最值钱、最能体现源智科技优势的那部分数据,赵文渊根本不敢往鼎盛的集群里放。

    就像一个特级厨师终於借到了顶级厨房,却只能把最精华的调料藏起来,用一半的配方做菜。

    这怎麽可能做出发光的料理呢?

    不过,这些都不是赵文渊现在最烦的。

    真正让他烦躁的,是韩路一从京城回来之前,给他下的新任务一研究国产显卡的适配。

    离开京城的时候,赵文渊兴奋的上了飞机。

    甚至可以说是热血上头。

    国产算力、自主可控、摆脱海外GPU生态,让大规模大模型训练和推理在国产显卡上成为可能。

    这几个关键词一拎出来,就能让技术人心跳加速热血沸腾。

    赵文渊甚至在飞机上就建了个文档,列了好几页的计划。

    《汤圆模型国产算力适配路线图》

    然後赵文渊一下飞机,连家都没回,直接拖着行李箱去了办公室。

    他接了一杯咖啡放在桌上,打开电脑,挽起袖子,就准备扯断套在国产显卡上的生态枷锁。

    结果,赵文渊一头撞在了墙上。

    不,甚至不能说是一堵墙那简直是一座山。

    CUDA生态困境,这个当年在谷歌折磨他的噩梦,这次又以更可怕的姿态出现了。

    在普通人眼里,显卡就是显卡,国外显卡能算,国产显卡也能算,无非就是性能高点或者低点。

    但对做AI大模型的人来说,显卡可不是一块单独的硬体,它背後是一整套生态。

    最底层是驱动,驱动之上是运行时,运行时之上是编程模型,编程模型之上是算子库、通信库、编译器、调试器、性能分析工具。

    再往上,才是PyTorch、TensorFlow、JAX这些训练框架。

    而大模型训练,又站在这些框架之上,调用各种高度优化过的算子和分布式训练能力。

    英伟达的CUDA生态就像是一座已经修建了十几年的超级城市,水电消防医院等等基础设施都已经运转了好多年了。

    而训练大模型就像在这个城市里举办一场大型的体育赛事。

    数十万的游客涌进来,对整个城市的承载能力都是巨大的考验。但因为是超级城市,所以在精心调度之下,还能做的到。

    而换成别的生态呢?你在大城市旁边的小镇,说我能不能也开个世界盃啊?

    当然可以试试,但这不是叫两个足球队过来踢球那麽简单,这个小镇从地下管网到商业生态都得重建一遍,等到它也成了超级城市了,就可以了。

    更要命的是,全世界的人都已经习惯了这个老城市的规矩了。他们写代码的时候默认CUDA可以调用,默认用的是英伟达的显卡,论文上说的也都是在英伟达上才能跑通的用例。

    不用英伟达?那你自己试试吧。

    本来能跑的代码,把CUDA的依赖删掉,一下冒出一千个错误来,修完了第一个错误,又冒出一千个来。

    模型能跑,不代表能跑的快;小模型能跑,不代表大模型能跑;单卡能跑,不代表多卡能跑;多卡能跑,不代表千卡集群能稳定训练几十天。

    而大模型最可怕的地方就在这里,它不是「能跑」就算成功,它还必须稳定、必须高效、必须鲁棒。

    必须能在极端昂贵的算力成本下,把每一张卡的利用率压到足够高。

    否则你花同样的钱,别人训练一个月,你训练三个月。别人烧一千万,你烧三千万。

    最後模型效果还不一定赶得上。

    赵文渊潜心研究了两天,越研究,脸色越难看。最大的困难不是技术上完全不可行。

    恰恰相反,很多东西理论上都有办法做。

    最大的问题是,工程量太大了。

    这不是一个天才程式设计师闭关三个月就能解决的问题。

    这是业内十多年、无数公司、无数开发者、无数论文、无数开源项目共同堆起来的生态。

    这就像愚公移山,别说是赵文渊一个人,别说是源码科技模型组的这点人,就算韩路一给他几百人的开发团队,花个几年时间,可能也就能把最核心的部分做一个可用版本。

    这现实吗?

    不现实。

    赵文渊狠狠的抓了抓头发,然後看着自己抓掉的头发,又心疼的摸了摸。

    他打开微信,找到一个在谷歌工作时的华人同事。

    那个同事当年给TPU做过适配工作。谷歌自研晶片加自研框架的路线,面临的是一样的困境,只是他们当年砸钱砸出来了。

    赵文渊写了一条长长的信息,把自己的困境简短说了一下。

    如何从训练框架层面对新硬体做适配?自研晶片生态早期最难补的短板是什麽?如果一个创业团队想在国产AI晶片上跑大模型,有没有现实一点的切入方式?

    这里面可能会涉及一些保密内容,赵文渊和这个前同事也两年没联系了,他本来也不预期一定会收到回复。

    没想到半个小时之後,对方回复了。

    看到信息的内容,赵文渊气笑了。

    回复很简短:「别想了,没戏。」

    原来人气极了真的会笑。

    过了一会,对方又发了更长的一段话过来。

    「TPU这条路不是创业公司能复制的。你们如果只是想省钱,直接买N卡。你们如果想支持国产晶片,那也应该让晶片厂来做生态,你们最多做应用层适配。总不能花几千万美元给硬体厂商补生态吧?」

    几千万?美元?朋友,你说保守了。

    赵文渊把手机锁屏,打开电脑,看着自己在飞机上写的那个文档。

    《汤圆模型国产算力适配路线图》

    有点儿讽刺。

    他把标题删了,重新打了一个。

    《汤圆模型国产显卡适配评估:暂不具备可行性》

    整层办公楼已经只剩下赵文渊一个人了,他透过玻璃看向外面的黑夜,玻璃上映出他自己的脸,看起来有点陌生。

    这时,手机震了一下,屏幕又亮了起来。

    他低头一看,是韩路一发来的消息。

    「文渊,我刚落地海城,周一早晨我们对一下模型训练的进度。」

    赵文渊犹豫了一下,不知道该怎麽回复韩路一。

    >
上一页 回目录 下一章 存书签