启动会在冰芯的总部办公楼。
冰芯和源智在同一个园区,两家的距离只有几百米。
韩路一四人直接步行过去。
冰芯这边除了廖伯韬亲自坐镇,工艺、封装、验证、生产各个部门的一把手也都在场。
两边一个是万亿市值的行业龙头,一个是千亿估值的行业新贵,双方都对这次合作表示出了足够的重视。
只不过,韩路一这边是抱着对合作主导权势在必得的态度来的,不知道冰芯是不是也有同样的想法。
两边寒暄、介绍,各自入座。
冰芯这边的工艺负责人姓丁,叫丁耀先,他先站了起来。
大家谈了合作意向之后,冰芯这边也没闲着,已经有技术团队配合着源智提供的原始设计图纸把L100的成品拆解了一遍。
这些信息都被放在了幻灯片里。
这个幻灯片很有工程师风格,很没有互联网风格。
一张幻灯片里面密密麻麻的参数、线宽、间距、金属层限制铺满了整个屏幕,让人眼花缭乱。
源智这边除了薛兆恒是大半个专家,其他的人对这个基本上是一无所知。
丁耀先对着幻灯片一通比划,介绍了一些技术细节,最后给出了结论:“如果把L100现有的设计迁移过来,芯片面积预计增加百分之三十以上,目标频率需要下调百分之十到百分之二十。”
虽然来之前源智这边已经统一了意见,不做L100,也不按照L100的思路去做L200。
但赵文渊还是忍不住问道:“怎么差了这么多?”
目标效率降百分之二十,也就意味着同样的预算、同样的算法,竞争对手迭代五轮的时间,你只能迭代四轮。
这对模型训练,甚至对大模型厂商的产品竞争力都有着致命的影响。
廖伯韬轻轻地叹了口气。
“丁工,源智的朋友们是新客户,可能不太清楚,你还是先给他们做个科普吧。”
丁耀先点了点头,转身走到白板边上,拿起一只马克笔,在白板左边写了一个“七纳米”,然后在白板右边又写了一个“七纳米”。
然后面向源智众人,开口说道:“虽然都叫七纳米,但七纳米和七纳米可不一样。”
“芯片生产,是用光‘刻’出来的,所以生产设备叫光刻机。光的波长越短,能刻出来的线条就越细,晶体管就能做得越小。EUV用的是极紫外线,波长只有十三点五纳米,一次曝光就能刻出来。”
“台积电的七纳米,用的就是EUV,每平方毫米能塞进去将近一亿个晶体管,良率稳、频率高,之前英伟达、苹果、AMD用的都是这套工艺。更别说现在他们都已经稳定生产三纳米,甚至两纳米了。”
“冰芯现在做的七纳米,因为买不到EUV,只能用DUV光刻机做多次曝光来模拟。DUV用的是深紫外线,波长将近两百纳米,想要刻出同样的线条,人家曝光一次,我们要反复曝光好几次。多一次曝光,就多一次误差。晶体管密度打了折扣,漏电控制也差。”
“同样一份电路设计图,从台积电搬到冰芯的工艺上,芯片面积就是更大、频率就是更低、功耗就是更高。”丁耀先说这话的时候语气也透露出一阵愤怒来。
韩路一听懂了,冰芯就像是在拿着粗刻刀去雕微雕,和拿着细刻刀的台积电比精细,怎么也说不上是公平。
他对丁耀先的愤怒也感同身受。
不是你不想赶超,但是从工具层面就被限制住了,再付出几倍的努力也很难赶得上。
讲完了科普课,丁耀先回到投影旁边,说道:“我们的建议是先把迁移做完,流片成功之后我们可以直接量产,之后工艺怎么提升,我们再想办法。”
这是冰芯的意思。
先把L100迁移到冰芯的工艺上,哪怕性能下降一些,至少成功率高。等第一批芯片生产出来,双方建立了配合经验,再谈后面的改进。
站在冰芯的角度,这个方案没有任何问题。
但韩路一不能接受。
如果源智只是想要一块能用的国产训练芯片,这条路当然可以走。
汤圆现在是用鼎盛的英伟达GPU集群训练出来的,在参数规模上其实比不上那几个竞争对手。而用自己的集群做做后训练还行,想要从预训练开始做起,源智的算力还差得远。
英伟达一直在发布新卡,国外的大模型厂商也一直在采购英伟达的新卡。
如果就这么按部就班地发展,源智和国外竞争对手的差距会越来越大,直到这个差距大到靠标注数据的质量优势也无法抹平。
所以源智不能接受这个方案。
韩路一开口了:“丁总,这个方案可以作为保底。”
冰芯这边几个人同时看过来:保底是什么意思?
韩路一朝薛兆恒点了点头。
薛兆恒将自己的电脑接入会议室的投影设备,打开上午刚刚整理出来的架构图。
屏幕上没有一块完整的大芯片。
而是四块面积更小的计算芯粒,围绕着一块负责通信和输入输出的芯粒,通过封装内互联连在一起。
“我们不准备迁移L100。”
薛兆恒说道。
“准确地说,L200不会再是一块传统意义上的通用计算芯片。”
“我们计划把大面积单芯片拆成四块计算芯粒,再配合一块成熟制程的输入输出芯粒。计算芯粒只保留汤圆训练真正需要的矩阵计算、低精度计算和少量通用指令,把其他能力全部砍掉。”
“当然,这只是雏形和大概思路,具体的设计我们还要时间才能完成。”
丁耀先看着这张架构简图,眉头拧在了一起。
源智的人也太突发奇想了。
冰芯其他的几个负责人也各自有不同的反应,但不管反应如何,都说明了一件事——
源智的要求出乎所有人的意料。
薛兆恒继续说道:“拆成小芯粒之后,单块裸片面积会明显下降。哪怕工艺缺陷密度不变,良率也能比大面积单芯片更容易控制。”
这里面的核心挑战就在于芯粒之间的数据同步和通信,并不是说把一个大芯片拆成四个小芯片就能拥有了四倍算力,片内互联的技术难度不亚于片间互联。
但这恰好是沈仲和的团队和HL-Link最擅长的地方,也是源智敢提出这个设计的原因。
现在这个设计是源智的团队在午餐会上集思广益之后讨论出来的结果。
理论上可行,但挑战很多。
“简单的说,我们不在冰芯的工艺上复制一块低频版的L100。”薛兆恒用手指了指屏幕,总结道,“我们要重新设计一组只在源智体系运行的芯片。”
廖伯韬面上没什么表情,但是在心里点了点头。
这个想法很聪明:先进制程受限,就放弃追求晶体管密度;大芯片良率低,就拆成小芯粒;冗余功能用不到,就靠专用架构来提高专精能力。
但是对于冰芯来说,这些可能都是问题。
封装负责人第一个开口:“小芯粒的晶圆良率可能更高,但是五块芯粒封到一起,封装良率会受影响。”
验证负责人也提出了看法:“行业内的训练栈都在每天更新,你们今天说只需要这些算子,下个月呢?半年以后呢?芯片设计生产的周期可比软件要长太多了。”
冰芯的人们不是为了推卸责任才提这些问题,相反,正是因为他们都是专家,才更能看出这种新设计所蕴含的风险。
廖伯韬等所有人都说完了,才转头看向韩路一。
“韩总,我很佩服你们敢想。我们可以陪客户攻关,也愿意承担正常的研发风险,但冰芯是一家制造企业,这个风险超过了我们能承受的范围。”
廖伯韬的语气温和,说话的内容也算客气,但他的意思很明白了。
冰芯不愿意做。
这场宣告源智和冰芯合作的启动会,在双方各自发表过一轮观点之后,就早早地陷入了僵局。
韩路一看着坐在对面这位年逾七十还在坚持工作的老技术人。
不愿意走源智提出的新架构技术路线,是不愿意承担财务上的风险,还是对这个技术路线的可行性不认可。
心念一动,视界打开。
【廖伯韬】
【心情:谨慎】
【隐藏心情:欣赏、担忧】
【核心担忧:源智科技提出的技术路线最终不可行,双方浪费的资源和时间可能拖垮源智科技】
关闭视界,韩路一略做准备,开口说道:“廖总,如果我们能够证明专用架构可以弥补工艺上的差距,冰芯愿意陪我们赌一把吗?”
会议室里的人都看向韩路一。
这能怎么证明?
韩路一看向赵文渊,说道:“赵总,麻烦你了。”
赵文渊起身,面向冰芯的众人,淡淡一笑:“各位同仁,做芯片我是外行,但是做训练,源智自信走在这个世界的最前面。”
他把电脑接到投影上,然后指着画面说道:“大家请看,这是源智内部的训练效率模拟器,是专门为了比较将现在的训练任务运行在不同的芯片上,能够达成的效率而写的。”
然后他打开一个预设的参数组合。
画面上显示出对应的算力、效率和预估花费时间。
“这是英伟达的旗舰卡所能达到的水平。”赵文渊说道,然后他又点了另一个加了星标的参数组合,“这是L100现在所能达到的水平。”
画面切换,L100的算力和效率大概能做到刚才英伟达旗舰的百分之六十多。
差距很大,但作为国产卡,在制程和生态都落后的情况下,实际上成绩已经很惊人了。
最后赵文渊用手指了指可以自由输入的界面,说道:“冰芯现在的工艺可以做到什么水平我不知道,但是只要把参数按照新架构输进去,我们现在就可以有一个预估值。”