一月十一日,周一。
上午九点,韩路一走进前滩中心十二楼,源码科技的办公室。
周末刚过,办公室里已经恢复了工作日的节奏。开放工位区里零星坐着几个来得早的工程师,两个人一边看屏幕一边低声讨论,茶水间门口还有人端着咖啡往回走。
看见韩路一,他们都停下来打招呼。
没人奇怪韩路一为什么几天没在公司,又突然回来,大家都渐渐适应大老板的神出鬼没了。
韩路一没有去自己的办公室,而是先去了苏念念的办公室。
苏念念的电脑屏幕上正放着陈建业发来的评审流程数据。她看到韩路一过来,点了点头,又转头把注意力放在屏幕上。
“你回来啦。”
韩路一笑了:“累死我了,周末睡了两天回血。我不在的时候还顺利吗?”
苏念念听他这么说,抬头仔细观察了一下他的脸色,才放下心来,说:
“上次和你说的,小姜做的那个智能体编程,你应该去开发区看一眼。”
“效果很好?”韩路一挑了挑眉。
苏念念笑了笑:“给你留个惊喜,等小姜来了你去问她,她提前准备了报告呢。”
韩路一出门看了看,姜亦心已经在工位上了。
韩路一走过去,站在姜亦心的工位旁边,轻轻敲了敲隔板。
“韩总,您回来啦!”姜亦心转过头,吓了一小跳。
“苏总说你做的智能体效果很好?”
“是钱晓乐和我一起做的。”姜亦心一边拉数据一边强调,“韩总您看,这是上周的数据。”
“全公司一线开发共三十人,上周合并代码分支一百二十七个。”
姜亦心指了指右边的柱状图。
“之前的数据是平均每周四十七个。”
她又指了指左边的柱状图。
“但是这个数字还没到顶,因为大家都在适应。”
姜亦心又在数据上加了一个筛选条件。
“你看,钱晓乐,她用的最早,上周二一天就合并了十个代码分支,这可都是生产项目。”
韩路一看着这个数据,不禁身体前倾,把右手撑在了姜亦心面前的桌子上。
他自己做了五年多的程序员,他知道每天十个合并是什么概念。
一个代码合并包括从理解任务需求,和其他部门沟通,同步信息,完成改动,编写单元测试一系列步骤。改动有大有小,但是平均下来,一人一天能有一个合并就是合理的工作量了。
现在钱晓乐一个人就做了十个人的量。
从很多年前开始,硅谷就鼓吹“十倍工程师”的概念,指的是一个非常厉害的天才程序员可以一个人做出十个普通程序员的贡献。
现在的钱晓乐,至少在这一天里,已经接近了“十倍工程师”的样子了。
更重要的是,这种能力不是天赋。
而是工具带来的!
只要使用流程继续优化,源码科技的三十个开发,产出还会被整体再抬高一个档次。
“代码质量呢?把合并的改动拉出来我看看。”韩路一问道。
姜亦心早有准备:“智能体首次提交的通过率现在是百分之六十七。大概有三分之一的任务现在的智能体还没法独立完成,会卡死,这个时候需要人工介入。”
然后她直接打开代码库,找出了钱晓乐最近合并的改动。
韩路一开视界扫过去,基本全是绿的。
这是非常夸张的效率提升了。
三十个人干出来一百个人的活来。
本来上个月韩路一还在盘算,如果要把开发团队从三十人扩到六十人,光是招聘、面试、入职培训,最快也要三个月。而海城这个市场上,能招到的合格工程师,月薪没有三万打不住。
三十个人,一年就是一千多万的人力成本。
可是不招人,源码业务发展得又太快,需求都做不过来了。
现在姜亦心和钱晓乐搞出来的这个东西,等于他不用多花一分钱,凭空多了七十个人。
不对。
比多七十个人还好。
多七十个人意味着多七十个人的管理成本、沟通成本、磨合期。
而智能体不需要开会,不需要团建,不需要一对一沟通,管理成本大大降低了。
韩路一看向姜亦心,认真地说:“小姜,这个工具的优先级提到最高。你需要什么资源,直接找苏总要。”
姜亦心还是第一次见韩总用这种语气说话。
“好的韩总!”姜亦心顿了一下,补充道:
“对了,还要多亏陈总新设计的评审流程,我们最近在开发基于大模型的评审工具,除了用BugKiller做漏洞检测之外,还加入对代码风格和可维护性的建议。”
听到“陈总”两个字,韩路一恍惚了一下,他还以为是陈博文。
然后他才意识到,姜亦心指的是陈建业。
哦,对了,他升技术负责人了。
韩路一又表扬了姜亦心两句,给小姜夸得都不好意思了才离开。
他还要去十三楼模型组的地方找赵文渊。
……
“文渊,你说的不太顺利,具体是指什么?”韩路一问道。
“韩总,国产适配的事,恐怕不可行。”赵文渊苦着一张脸,开口道。
“技术上有难度?”韩路一挑了挑眉,已经准备自己开视界上了。
“不是。”赵文渊叹了口气,“工程量太大了。”
“CUDA做了十几年的生态,你让我带着模型组这几个人,别说适配生态了,一个算子的迁移都搞不定。”
韩路一倒是不觉得意外。
生态要是好做,国内的这些硬件厂商早做完了,哪还有这些问题?
“拿个例子来看看。”韩路一说。
赵文渊觉得韩路一有点儿多此一举。
就算你再能写,也不能让你一个一个写过去啊。
况且你不是已经在做标注了吗?
赵文渊没把这些话说出来,乖乖地从代码库里找出了一个算子的代码做例子。
scaled_dot_product_attention
这是变形金刚(Transformer)架构中比较重要的一个算子,可以说没有这个就做不了大模型。
“N卡那边有专门的函数,性能和精度都做过深度优化,我手头连个等价实现都没有。”
韩路一拉过一个椅子坐在电脑前,接过鼠标,打开浏览器把相关的CUDA源代码、国产显卡的IR文档、HCCL SDK都打开来。
赵文渊在旁边看得一愣:
“韩总,你要干什么?——你不会是要、要自己写吧?”
韩路一头也没抬:“试一试。”
试一试?赵文渊心里吐槽,韩总,这可是一个团队几个月的工作量。
韩路一已经打开视界,把CUDA实现中的几个关键地方都扫了出来,然后把要适配国产显卡的要点总结了一下。
接着韩路一在赵文渊的电脑上打开了姜亦心的AI智能体编程工具。
但他没把视界看到的关键信息都输进去。
他想先看一眼,仅靠模型自己能做到什么程度。
他输入了第一段提示词:
“把这个CUDA算子翻译成国产卡IR实现。要求精度误差小于1e-5,性能不低于N卡实现的70%。使用下面三份文档作为上下文。”
然后把浏览器里的链接地址都打了进去。
很快AI智能体开始自己分解任务、解决任务,最后汇总。
三分钟后,第一版结果就出来了。最终性能接近68%,但精度偏差太大了。
一个大大的红色FAIL显示在屏幕上。
赵文渊在旁边松了一口气。
这才正常嘛。
他对韩路一说:“韩总你看,这就是我说的难点,做不过来——”
韩路一没有回应赵文渊。
他重新打开CUDA的源代码,同时打开了视界。
现在韩路一已经完全了解问题是什么了,赵文渊既不是解决不了开发难度,也不是没有方向和思路。
他只是没有时间像英伟达之前做的那样,一点点找到和他们硬件最匹配的参数。
想要做可以,老老实实的把人力物力和时间花进去,最后也能把适配做完,但这才恰恰是英伟达的护城河所在。
如果自己适配的代价比直接买英伟达的成品还大,谁还有动力去做这件事?
现在唯一的好处是,视界可以不用一步一步实验,直接找到最优解,甚至不仅是最优解,连为什么这个是最优解,怎么来的都知道。
比如,为什么Softmax的最优解不是垂直实现而是分成了三个阶段?这不是额外制造了冗余吗?
为的是避免在少见情况下的数据溢出问题。
再比如,什么是矩阵乘法分块的最佳尺寸,太大了放不下,太小了效率低,这个本来要一个一个试才能得到的数据,视界直接就能给出解答。
很快,韩路一把几个关键数据输入到第一版的提示词里,这样智能体就不会自由发挥,尝试去找最优解,而是按照韩路一的提示词执行即可。
“Softmax使用三阶段算法,并且在第二阶段的Reduce中,确保局部最大值的指数和更新顺序保持一致。”
“矩阵乘法的大小使用64x64。”
……
韩路一连续输入了十几条具体的调优指令,然后把修改后的提示词一起发给了智能体。
智能体又回去勤勤恳恳地干活儿去了。
五分钟后,一个大大的绿色PASS出现在屏幕上,效率和精度都达标了。
赵文渊坐在旁边,人已经傻了。
他不顾韩路一还坐在电脑前,把头凑到屏幕前面,把测试报告从头到尾看了一遍。
精度误差是2.3e-6,远低于1e-5的要求。
性能也达到了N卡实现的83%。
不信邪的赵文渊直接打开生成的原始代码打开逐行看了起来。
他越看越沉默。
整段代码的结构和之前一次生成的大差不差,但是所有需要经过大量测试才能得出来的结论都被替换成了新值,而这些新值导致了结果的变化。
这是一个对底层硬件有深刻理解的人才能写出来的东西。
不,准确地说,是一个对底层硬件有深刻理解的人,才能指导AI写出来的东西。
赵文渊转过头,看着韩路一。
“韩总,这些值,你都是怎么确定下来的?你怎么知道他们能过?”
韩路一往后靠在椅背上,微微一笑:“我看了文档。”
“我去,原来你看了文档啊,不早说。”赵文渊先开了个玩笑,然后声音突然拔高了,“我也看了两天文档,跑了十几个测试,我都没找到这个tile尺寸,你看了几分钟就看出来了?”
韩路一没有回答,只是接着笑。
赵文渊盯着他看了好一会儿,最后像是泄了气一样靠回椅子上。
“行吧。”他叹了一口气,说道,“我不问了。”
他之前不是没想过用AI来做这些工作,但是AI根本做不了。每次跑出来的结果,不是卡死,就是偏差太大。
怎么韩路一一上手就好用了?
赵文渊现在只想火速删掉发给韩路一的那个共享文档的标题。
韩路一在他眼前,把他觉得不可能的事情做出来了。
如果这个不是偶然呢?
如果scaled_dot_product_attention可以这样做,那其他算子呢?
什么暂无可行性啊?
什么叫“别想了,没戏”啊?
这不是有戏了吗?
他现在非常想让那个前同事过来现场看看。