晨曦?
不少人顿时神色一愣,眼里满是茫然。
国内的算法大牛屈指可数,但似乎从未听说过这个名字?
只有为数不多的几人面不改色,对此却并不意外。
这几人都有不低的权限,早就知晓这位算法大牛身上应该有密级。
不过对于他们来说,晨曦的身份并不重要,他所掌握的那些知识才是最重要的。
赵小刚把话筒拉了过来,轻声道:“晨曦老师,我是我们这边算法组的技术专家兼组长,同样也是本次小课的主持人,我代我们全组组员欢迎你,感谢你的帮助。”
“呃......”
对方愣了一下,随后开门见山道:“废话不多说,这篇文章有什么不懂的,现在可以提问,我现场解答。”
赵小刚见这位“晨曦”如此不拘小节,心里暗暗舒了一口气。
能爬到技术专家这个位置,赵小刚考虑十分周全。
他一开始说话极为客气,生怕怠慢了对方,惹得对方不快。
但很显然,对方并不在意这些繁文缛节,直接单刀直入表达了自己的态度。
这让赵小刚对这位算法大牛的性格有了几分把握,说话也不藏着掖着,直接道:“在正式提问之前,我有个小小的疑惑,不知可否问一下?”
“请说!”
“我们在推演复现你的文章时,发现你的文章所涉及的领域似乎是我们从未到过的地方,虽然目前还在理论汇算阶段,但是请容我问一句,你是否已经完成了人工智能的建设?”
此话一出,现场一片死寂。
所有人不由竖起了耳朵,心也同时提了起来。
一分钟......
两分钟......
足足过去了五分钟,那道苍老的声音才缓缓响起。
“很抱歉,我并没有完成人工智能的建设。”
听到这个回答,众人心底有些失望,亦有些欣喜。
失望的是连这种行走在所有人前面的先行者都没能完全踏足这片领域。
欣喜的是,他们还有机会开辟一片新的天地。
就听那声音再次在所有人耳边回荡。
“具体有两个原因。”
“第一,虽然我已经完成了人工智能有关深度学习部分的框架模型,但如你所见,这块非常复杂,根本不是我一人之力所能完成的。”
“第二,则是目前的芯片技术很难支持人工智能的正常运行。”
众人闻言一怔,赵小刚连忙问出了所有人的心声:“第一个我可以理解,但第二个怎么说?”
苍老声音娓娓道来:“提到芯片技术,我就不得不提我认为的人工智能。”
“在我所架构的人工智能里,需要不断通过训练来提升人工智能的能力。”
“那么回到核心问题,训练的本质是什么?”
众人纷纷陷入了沉思。
对于机器训练,现场众人并不意外,以前是数据标注员进行数据标记投喂,而一旦以深度学习算法搭建起了人工智能的框架,计算机就可以自行进行数据的标记处理。
有人当即道:“训练的本质就是对于数据的处理能力。”
“这么说也没错。”
“不过在我看来,人工智能训练的本质是海量矩阵乘法和张量运算。”
“我一般把这种能力,称之为算力,而我们目前所遇到的,就是算力严重不足。”
众人面面相觑,当即有人迟疑道:“目前CPU的算力还不够吗?”
“海量矩阵乘法和张量运算的运算规则十分简单,其实就是乘加法,但这个量次非常高,只是人工智能的正常运行量,就足足有亿万次之多。”
“CPU虽然可以做,但从架构上来说,核心太少,并不适合做这种高频低难度且大量重复推演的工作。”
“那如果选用GPU呢?”那个之前被一群专家们调笑的孟姓专家,这时突然开口问道。
晨曦略一沉默,随即道:“GPU确实是比较理想的算法芯片,但目前最顶尖的GPU次级量还是太低,根本无法满足人工智能的日常需求。”
现场顿时响起了一阵窃窃私语,很快就归于沉寂。
几位专家彼此对视了一眼,目光不由齐刷刷落到了赵小刚身上,眼神里带着几分同情。
如果真如这位所说,人工智能现阶段就是个鸡肋,只有等硬件出现大的突破,才可以真正实现人工智能。
现场如同被当面泼了一盆冷水,所有人心里哇凉哇凉的。
赵小刚脸色阴晴不定,足足过了好一会儿,这才咬着牙道:“好的,感谢老师的解答,我的问题问完了。”
晨曦鼻子轻轻哼了一声,问道:“还有什么问题吗?”
现场短暂寂静了一瞬,“哗”地一声,好几个人同时站了起来,争先恐后地提出了问题。
会议另一头沉默了片刻,就听晨曦缓缓道:“我大致看了一下,问题集中出现在了我省略步骤的地方,这样吧,我现场重头开始推导,有什么问题随时提问。”
现场众人顿时大喜。
赵小刚也不由挤出了一抹微笑,连连道谢。
现场逐渐陷入了沉寂。
只见空白的共享屏幕上开始快速跳动出一行行算法公式。
这些算法公式,现场所有人再熟悉不过。
是深度学习算法!
所有人看着投影上的推演步骤,神色轻松。
他们琢磨了整整两天,早就吃透了这部分的内容。
大抵是起着演示作用,晨曦的推演步骤格外详细,看着丝毫不费力。
现场并没有人催促,所有人都耐心看着投影上的推演步骤。
共享屏幕不断向下拉动,开头的那部分推演公式迅速消失。
随着越来越复杂的公式和方程出现在投影上,渐渐有人皱起了眉头,拿起了笔,开始在纸上做起了类似的演算。
终于,有人忍不住问出了第一个问题。
“晨曦老师,请问你在这里为什么不使用BP算法微调,而是从顶到底逐层做线性回归微调?”
不断跳动的算法推演戛然而止,紧接着响起了那苍老的声音,如同神明一般威严。
“BP算法确实是个好算法,但用在这里却并不合适。”
“原因有二。”
“第一,梯度消失!”
“我们的网络有七层,BP从输出层往回传误差的时候,梯度经过sigmoid的导数要连乘六次,每层导数最大才0.25,六次连乘之后,底层的权重几乎不动,换句话说,在最底层时,就会出现梯度消失的状况。”
“第二,误差耦合!”
“BP是全局性的微调,所有层并无权重之分,同时更新,但我们的预训练是逐层学习,每层已经学到了相对独立的特征表示,BP会把这些数据全都搅在一起,从而破坏这种层次化结构,从而引起误差耦合现象。”