陈明默默降低正在进行的学习关注度,将所有关注度投入到随即分批算法的优化之中。
【任务已添加】
【重构·随机分批算法】
【分配专注度:90%】
【耗时:未知】
他并未关注于为什么耗时是未知,直接就开始试图重构随机分批算法。
随机分批算法的基础是用随机性换取效率。
其核心在于只需通过随机抽样得到一个有代表性的子集,就能以高概率逼近全量结果。
而这,是概率论与统计学的范畴。
以此可以延伸出此算法的核心问题。
在给定计算预算的情况下,如何设计分批策略以最小化达到目标精度所需的梯度评估次数?
不同于之前灵活的算法运用,陈明此刻在通过强大的分析力对这个算法进行重新推演。
如果说之前的算法修改是对原定算法的旁枝末节进行修剪,那么现在他在试图在起点和终点间找到另一条更为便捷的路。
前者是修改,后者则是创造。
他心血来潮般从一旁拉过一沓草稿纸,在书页上唰唰快速写动。
他已经很久没有用过草稿了,灵敏的思绪已经不需要在这种实体介质上进行演算。
但一个东西存在必定有他的原因。
陈明此刻就感受到了草稿纸的用处。
在捏着笔快速书写的时候,他的脑海中在进行不断推演,手的速度已经全然跟不上思考的速度,但这恰好让他抽出闲暇,基于当前的步骤向四面八方扩展出了新的想法。
“引入计算机架构因素后,理论最优批大小需要通过架构感知模型重新计算.....”
“在特定条件下,学习率衰减可被批大小增长替代,这可以为联合调度提供了理论基础......”
“加速收敛也需要特别处理,这方面使用方差缩减算法......”
陈明嘴唇轻轻嗫嚅,在草稿纸上源源不断地写下一行又一行晦涩难懂的小字,写了足足一页,便翻到下一页。
看到这幅场景,周昭宁立马知道陈明这是又在忙活其他事情,并不再打扰他,专心致志地催使小人战斗。
整个书房很快就只剩下敲打键盘和笔尖摩擦草稿纸的声音。
大概过了一个小时,晚饭的香气顺着门缝传入屋里。
周昭宁蹙了蹙小鼻子,却并没有太大的感官,她放学吃了炸串,并不是很饿。
陈明如同闻不到一般,还在草稿纸上书写着。
他已经写了整整五六页,但一个算法的推演过程并不是只靠页数多就能获得最终的胜利。
他必须要用计算量最小的方式将目标所要求的精度结果计算出来。
那种感觉,就好像要在一片碎石滩上进行分门别类,再从每个类别的石头中找出最有代表性的那几个。
相比之下,数学可比找石头严谨得多,统计学算法也不是看谁长得像就是谁。
陈明写着写着,笔尖倏然停了下来。
他盯着眼前熟悉的笔迹,小脸皱成了一团。
放在二十年后,随机分批算法也无疑是最为领先时代的算法之一。
随着AI的快速发展,GPU被炒至天价,甚至达到了一U难求的程度,不少预算不足的机构都会选择用多个低算力的GPU并发来补充算力不足的短板。
但这个算法本就是基于当时的CPU运算条件所研发的,想要降频运算,就算是以他的脑子,一时间也觉得有些束手无策。
那种感觉,就好像眼前有一条犹如天堑的鸿沟,而这条鸿沟之间,似乎只有原定的一座吊桥。
“你写完了?”
周昭宁好奇地探过脑袋,朝着草稿纸上瞅了两眼,嘴上忍不住嘀咕道:“你写的都是什么?鬼画符一样。”
陈明皱着眉头,问道:“有什么事情吗?”
周昭宁皱了皱小鼻子:“张姨喊咱们吃饭呢!”
“啊?什么时候?”
陈明这才后知后觉,闻到了满屋的菜香。
两人一起出了书房,看到了摆在饭桌上的几碟菜。
“张姨!你做得菜好香啊,比我妈做得都香!”
周昭宁立马开始麻利得给张太后提供情绪价值。
陈明则坐在饭桌边,留出大量的专注度继续思考算法问题,等着张雪梅把饭端过来。
张雪梅和周昭宁端着饭从厨房走了出来。
一出来,张雪梅看到坐在饭桌旁的陈明,就气不打一处来。
“你看看你,宁宁都知道帮我盛饭,你一出来就等着饭送上口,这儿子和女儿果然还是不一样。”
陈明半张着嘴巴:“不是你上次说不要我帮着盛饭的吗?”
张太后理直气壮:“不让你帮,你就不来啊。”
陈明一脸无语,看了眼周昭宁,后者无辜地眨了眨眼睛。
算了,随她吧。
陈明摇了摇头,开始专心吃饭。
张雪梅则和周昭宁边吃边说,弄得陈明好像被孤立了一般。
可能是觉得自家儿子有些格格不入,张雪梅突然看向了陈明:“阿明,等下吃完饭你的东西要开始收拾了,周日咱们家就搬家了。”
“好的妈妈。”
“你和你爸的东西都分好了,别都混在一块,回头搬个家弄乱了不好收拾。”
“好的妈妈。”
陈明随口应付一句,下一刻忽然动作一顿,像是隐隐抓住了什么,猛地抬头看向了张雪梅。
“妈妈,你刚刚说什么?”
张雪梅愣愣道:“你跟你爸的东西都分好啊......”
“我怎么没想到!”
陈明眼睛一亮,整个人如同被打通了奇经八脉一般,一瞬间所有思路都重新打开。
“我始终在受原算法的影响,按照原算法进行分类汇算。”
“但实际上,原算法的数据分类方式是根据他们的汇算方式所量身打造的,所以无论如何用他们的数据分类方式进行处理,能够抽取代表性数据的方式只有一个。”
“而我要做的,无疑是重新组建数据分类方式!”
陈明眼睛锃亮,脑海中一瞬间推演出近十种数据分类方式。
几乎同时,眼前的小字开始快速变化,原本的耗时未知跳出了准确时间。
【重构·随机分批算法】
【分配专注度:85%】
【耗时:120分钟】