书海阁
书架 邀请 登录

第190章 捅破天花板的数学家!

作者:无机糖字数:5.2千字更新时间:2026-09-16 10:56:12
第190章 捅破天花板的数学家!

上午九点整,第一场报告准时开始。

主讲人是斯坦福的一位副教授,讲结构化预测里的推断问题,内容扎实,推导漂亮,放在任何一个正常的年份,都够底下的人认认真真记一上午笔记。

可惜今年不正常,今天尤其不正常。

老黄等大佬都看着他,但一个个都是心不在焉的样子。

后面坐着的人更是如此,有人笔记本上的确写满了字,但凑近看全是对下午的预测,列了六七条,每条后面还标了自行估算的概率。

左边隔两个座位,两个谷歌的工程师在共享文档上敲字,交流对漆昊新技术的看法。

再往后几排,有人干脆在刷会议官网,仿佛多刷几次就能刷出漆昊要讲的内容。

台上的副教授显然也察觉到了气氛不对,讲到一半,他翻页的手停了停,对着满场心不在焉的脸,自嘲了一句:“我知道各位在等什么,这样,我尽量在中午之前讲完,绝不占用大家的时间。”

全场哄笑,响起了这场报告开始以来最热烈的一次掌声。

副教授:……

真是谢谢你们了,虽然这个掌声让我更难过了。

第二场主讲人见此情况,自然也很有自知之明,讲完自己的东西就麻溜下台了。

中午十二点,午餐时间。

会议中心外面三条街全是餐厅,从牛排馆到华国餐厅应有尽有。

往常这种规模的会议,中午会场准得空一半,学者们对午餐社交的热情,从来不亚于对学术的热情。

但今天,两千多人,几乎没人离场。

大厅侧面的简餐台前排起长队,所有人拿了三明治和咖啡就往回走,端着纸盘子站在会场各处,边吃边聊,眼睛却都跟装了雷达似的,时不时往主会场入口和后台通道看。

这场面就像机场接机一样,两千多个人,全在等同一个人出现。

老黄端着盘子,跟马斯克、哈萨比斯站成了一小圈。

“今天有人见过漆昊吗?”

三人对视一圈,集体摇头。

“我十一点半绕着会场走了一圈。”

马斯克说:“后台、贵宾室、停车场,都看了,没有。”

老黄咬了口三明治,忽然乐了:“你们说这叫什么事?我们仨,一个造火箭的,一个搞人工智能的,一个卖显卡的,大中午的站在这儿啃三明治,就为了蹲一个华国的年轻人,传出去谁信?”

马斯克答得飞快:“不过十年以后回头看,今天这顿三明治,可能是我们仨这辈子性价比最高的一顿午餐了。”

哈萨比斯冷静说道:“等漆昊新技术出来了才知道情况。”

下午一点五十分。

主会场内座无虚席,过道里还站满了人,据说会议中心的消防负责人来交涉过一次,被杨力昆连哄带求地按了回去。

一点五十五分,人声开始变低,在没有任何广播提醒的情况下,整个会场就像被人拧小了音量旋钮一样,自动变小声了。

一点五十九分,两千多人,鸦雀无声。

田院士坐在其间,暗暗惊讶。

他以往参加的学术会议,等级森严,圈层分明。

院士、大佬、普通学者、行业新人,界限清晰,气场各不相同。

但此刻,在这个新兴的领域里面,圈层好像消失了。

不管是身家千亿的行业巨头,还是深耕半生的学界大佬,或者是初出茅庐的青年学者,所有人的心态都一模一样。

期待、忐忑甚至还有一点敬畏。

没有任何人摆资历,端架子。

在漆昊即将登场的这一刻,所有头衔,荣誉,资历全都一文不值。

两点整。

会场顶灯毫无征兆地暗了下去,两千多人的呼吸声齐齐一滞。

黑暗里,所有的灯光向前方汇聚,打在那块巨大的屏幕上。

屏幕,亮了。

黑暗中,屏幕亮起的第一秒,上面没有标题,没有名字,没有任何客套话。

只有一个界面。

一个朴素到简陋的训练监控界面。

左边是一条正在实时下降的损失曲线,右边是一块滚动刷新的日志区,字符一行行往上跳,底部一排状态栏显示着集群负载、吞吐量、当前轮次。

任何一个在深度学习领域的人,都对这个界面熟悉得不能再熟悉。

全世界每一个深度学习实验室,每天都有无数块屏幕上挂着一模一样的东西。

所以开始全场没什么反应。

直到前排有人读出了状态栏左上角的一个参数:“网络深度……100层?”

“我是不是眼花了?”

一瞬间,整个会场响起了一片压抑不住的吸气声。

“多少?!”

“100层?他打错了吧?是不是10层,不对,10层也太少了!”

“肯定是显示bug,100个神经元还差不多!”

坐在中间区域的一个伯克利博士生站了起来,眼睛盯着屏幕,手里的笔记本啪嗒一声掉在地上都没察觉。

他导师坐在旁边,一把没拉住他,只好跟着看向屏幕,然后自己也缓缓地站了起来。

因为此时,屏幕上那条损失曲线,在降。

它不是所有人熟悉的那种深层网络训练时惨不忍睹的波动,它就是在匀速的往下降。

“这不可能啊。”辛顿的声音从第一排传来。

老爷子这句话说得不响,但此刻,这就是全场两千多颗大脑的共同想法。

要知道,2012年年初,全世界深度学习的最前沿在哪?

在二十层出头的地方卡着,动弹不得。

QInet八层,已经是横扫深度学习的存在,此后各家实验室疯狂加码,十五层,十九层,二十二层,靠着漆昊最新的吉洪诺夫-漆理论,他们最多堆到了二十五层,越往上堆,训练越困难,梯度传到底层就衰减成了一堆没用的数字噪声。

更诡异的是,就算用尽各种手段把深网络勉强训出来,它的表现居然还不如浅层。

而现在,屏幕上那个数字是100。

他们做梦都不可能训到的数字!

“这应该是演示动画。”

一个声音响了起来。

说话的是谷歌那排里的一位资深研究员,说:“这一定是预先录制的演示动画,这说明不了任何问题!”

这话让大家都放松了下来。

对啊,是演示动画的!

好多人如梦初醒地点头,紧绷的神经松了下来,只要不是真实的,世界观就还能保住。

“我们想看真的。”

那位研究员环视四周,得到了大片附和的目光,底气更足了:“实机、实数据、实时训练,深度学习圈不看PPT,漆,给我们看点真东西!”

“对!看真的!”

“上真机!”

附和声此起彼伏,会场里的气氛从震惊变成了躁动,这躁动里一半是质疑,另一半是期待。

就在这时,舞台侧面的阴影里,传来了脚步声。

漆昊走了出来!

漆昊上台后,说了今天的第一句话:“抱歉,让各位失望了,刚才大家所看到的,不是模拟,也不是动画。”

他抬手指向大屏幕:“你们现在看到的,是我实验室集群上正在进行的一次训练任务的实时监控画面,延迟大约1.2秒,这个网络是一个月前开始训练的,它目前已经有100层了。”

会场安静了一下,瞬间热闹了起来。

“实时的?!”

“一个月?一百多层的网络训了一个月就收敛成这样?!”

“不可能绝对不可能,我上个月训一个二十六层的网络,光让它别崩就调了四个星期!”

刚才那位谷歌的研究员还站在原地,脸上的笃定一点点消失。

他做了最后的挣扎:“你怎么证明这是实时?监控画面也可以造假。”

漆昊看着这个大聪明,他毕竟是佩戴过红领巾的男人,所以肯定会助人为乐,帮助在场的人来理解他的新技术。

于是他说:“问得很好,我正要展示这个。”

“我们就用李飞飞教授的Imagenet数据集来测试,李教授,我需要用你最新的竞赛数据集,一百二十八万张真实原图,一千类分类任务,这样全程公开透明,现场就可出结果。”

这事之前漆昊就跟李飞飞提过,所以这时她站起来说:“没问题。”

“Imagenet数据集标注严谨,测试闭环,不存在任何人为操作空间,如果能在这套数据集上实时跑出有效精度,足以证明模型真实有效,我很期待接下来的结果。”

有数据集创始人亲自站台背书,现场质疑的声浪一下弱了大半。

有研究员这时提到:“漆,能否现场清空原有训练权重,随机初始化参数,从零开始训练,不加载预训练模型,不调用后台缓存数据?”

这个要求非常苛刻,堪称学术界最严苛的验证标准。

从零随机初始化训练,意味着没有任何前期优势,所有参数、权重全部从头迭代,任何作弊、预演的可能都会被完全杜绝,是最无可辩驳的实力证明。

全场目光再度聚焦在漆昊身上,所有人都在等他的答复。

不少人心里已然笃定,就算模型真的能稳定收敛,从零训练一百层超深网络,耗时、算力、难度都是天文数字,绝不可能现场完成。

可漆昊只是轻轻点头:“这些条件都不算难,可以全部满足。”

说完,他迈步走到操作台旁,手指在键盘上,敲击了起来。

屏幕画面瞬间切换,原本的长期训练监控界面消失,现在出现了一片干净的命令行窗口。

【权重初始化完毕!】

【加载Imagenet完整数据集……】

【数据集校验通过:1281167张训练集、50000张验证集、1000分类任务】

【清空历史梯度缓存,开启全新训练任务】

一条条绿色日志飞速刷屏,展现在两千多人眼前。

全场所有人都屏住了呼吸,盯着在屏幕。

辛顿清楚从零训练深层网络的难度,哪怕是二十五层网络,随机初始化后极易直接崩损,梯度瞬间归零,根本无法迭代更新。

更别说整整一百层的超深结构,在当下的学术认知里,这根本是不可能完成的任务。

后排一名MIT教授语气笃定:“一百层网络从零训练,开局直接梯度消失,连第一轮迭代都撑不过去,数学上根本不成立,漆昊对自己太自信了。”

旁边几名学界大佬纷纷附和。

可就在众人议论纷纷之时,屏幕上的日志突然跳出全新的内容,让全场的人闭了嘴。

【第1轮迭代完成】

【训练损失:6.812,验证损失:6.901】

【梯度传递完整,无消失,无爆炸,参数更新正常】

没有崩溃,没有报错,没有梯度归零!

整整一百层的超深网络,随机初始化开局,第一轮迭代稳稳跑完,梯度完整穿透百层结构,全程稳定无异常!

“怎么可能?!”

“二十五层以上就梯度断层,一百层居然能完整传梯度?!”

辛顿缓缓站起身,他失态地盯着屏幕上平稳跳动的损失数值,说:“梯度完整保留,一百层网络,反向传播无衰减,这根本不符合现有推导逻辑。”

现有所有深度学习理论、梯度计算公式、正则化体系,全部指向同一个结论:深层必衰减,超深必崩盘。

可漆昊的模型好像已经推翻了这套逻辑!

此时屏幕上的迭代还在飞速进行,速度平稳得离谱。

【第10轮迭代完成】

【训练损失:4.217,验证损失:4.302】

【Top-5准确率:28.7%,稳步攀升】

损失持续稳定下降,准确率匀速上涨,没有丝毫波动,完美避开了所有深层网络的训练通病。

刚才提出质疑的谷歌资深研究员,此刻难以置信地看着屏幕:“不对……公式不是这样的,梯度衰减系数不可能凭空消失,这不符合逻辑……”

屏幕上的迭代依旧在飞速推进,数据实时刷新,每一秒都在刷新全场的认知。

【第55轮迭代完成】

【训练损失:2.103,验证损失:2.187】

【Top-5准确率:85.3%】

这个准确率,已经稳稳超越了2011年ImageNet竞赛的冠军模型,也就是漆昊本人去年的模型!

所以漆昊现在就已经超越他去年的模型?!

马斯克和老黄对视了一眼:“老黄,我没有看错吧?”

“我敢肯定没有,因为我戴着眼镜看,也是一样的结果。”

“离谱,太离谱了。”

他们后面,一名微软研究院的资深研究员苦笑:“一百层网络从零训练就有这样的效果?”

“我们团队打磨半年的模型,还不如人家五十五轮迭代的原生效果!”

“难以想象,它继续迭代后正确率有多高!”

屏幕上的训练依旧在继续,曲线依旧平稳下降,没有丝毫要出问题的样子。

【第100轮迭代完成】

【Top-5准确率:89.2%】

最终数据定格,刷新了ImageNet数据集的全球最高纪录!

漆昊看着这结果,十分满意。

他现在就是秦始皇触电,赢麻了!

漆昊暂停训练,面向全场两千多位全球顶尖学者、行业巨头,从容说:“实时训练、公开数据集、从零迭代。”

“一百层残差网络,稳定收敛,有效拟合,实测准确率89.2%。”

“刚才各位的疑问,现在可以解答了。”

短暂的静默过后,全场爆发出雷鸣般的掌声!

漆昊的话,宣告了旧时代落幕,新时代降临!

会场上无数学者只觉得身上热血翻涌。

他们入行以来,一直被前辈告知层数有上限,梯度有枷锁,领域有天花板,只能在固有框架内小修小补,内卷跟风。

可漆昊用一场实时实测告诉所有人。

所谓的行业天花板,只是前人的认知局限!

而捅破天花板的人,是个数学家!

此章为VIP章节,需要订阅后才能继续阅读

  • 价格:0屋币(1元=100屋币)
  • 购买
设置
作品详情 加书架
章节进度
评论 (0条)
评论加载中...
作品封面 正序
目录加载中...
加书架
上一章 目录 下一章

设置