书海阁
书架 邀请 登录

第一百四十二章 唯一的解释

作者:路大头字数:3千字更新时间:2026-09-27 14:23:24
第一百四十二章 唯一的解释

鼎盛大厦,四十九层,郑晓波的办公室里。

程远和刘大海并排坐在沙发上。程远的膝盖上放着一个黑色文件夹,刘大海还是那件灰色连帽衫,空着手,什么也没带。

郑晓波坐在两人对面的沙发上,开口说道:“说说吧,昨天的会开得怎么样,复盘一下。”

程远把文件夹翻开,说道:“郑总,是我没做好,整个会议都没在我的节奏里。”

郑晓波没说话,没想到程远上来就先认错。

“他们不是为了万物生和开物的事情来的,为的是另一件事。他们自己带了一套方案,想让咱们用算力来折算投资,换股。”

郑晓波问道:“换股,换的什么股?”

“不是源码科技的股份,韩路一打算成立一家新公司,专门用来做通用基座模型,换的是这个新公司的。”

郑晓波冷笑了一声,空手套白狼啊。

但是要的不是钱,而是算力?难道他们是真想做点儿东西出来?大模型?就凭他们?

程远看郑晓波不再关注谈判不顺利的事情,知道自己的锅已经甩掉一半了。

毕竟对方要谈的事情和我们预期的就不一样,自然不会在预定的节奏里了,非战之罪。

然后他翻到第一页做好标记的地方,开始复盘:“刘博士先做了展示,他们的反应很平淡,然后直接给我和刘博士做了一个反向展示。”

“反向展示?什么意思?”郑晓波问道。

程远看了刘大海一眼,说道:“技术这方面我不太懂,具体的让刘博士来讲吧。”

郑晓波看向刘大海:“大海博士,你说说?”

刘大海没听出郑晓波和程远这段对话里隐藏的意思,老老实实地开口说道:“我先给他们展示了坤元,但是他们突然拿出电脑,说是他们也做了一个模型,想让我们也测一测,我心想测测就测测呗,看看效果,一共测了三道题,都是和坤元一起跑的——”

说到这,刘大海的嘴里一股苦味儿,脑海中又冒出昨天那阵不好的回忆来。

任谁辛辛苦苦带着团队干了好几个月的成果被别人碾压,心里也不会好受的。

刘大海接着说道:“三道题,他们那个小模型表现的都比坤元要好。然后我问他们要了跑分,意图理解这一块,他们跑到了85。”刘大海说完看了郑晓波一眼,估计郑总应该不知道这意味着什么,补充了一句,“咱们坤元是78。”

郑晓波挑了挑眉毛,效果竟然这么好?

他的第一反应是,程远和刘大海不会被人给骗了吧?

“这个技术,会是真的吗?有没有可能是在骗我们?”郑晓波问道。

作为鼎盛这样一个科技巨头的掌舵人,郑晓波不需要懂技术细节,但他要保持对技术边界的敏锐。

什么东西做得到,什么东西做不到,什么东西现在的技术做不到但是将来可能做得到,郑晓波必须清楚,才能更好地做出战略判断。

刘大海摇了摇头,说道:“我一开始也寻(xin)思过,但是他们这个应该是真东西。”

程远看了看刘大海,既然技术负责人给了背书,他肩膀上的锅就更小了。

“会不会是过拟合?”郑晓波追问道。

刘大海愣了一下,没想到郑晓波会问出这么专业的问题。

刘大海作为首席科学家,虽然职级高,但平时大部分时候还是和自己的直属副总裁汇报,直接和CEO汇报的机会并不多,所以头一次知道郑晓波对机器学习也有涉猎。

过拟合可不是在大模型时代才有的新概念了。

在机器学习里,数据会分成训练集和测试集,训练集是用来学习规则的,测试集则是用来检查结果的准确度的。

这里面的一个小诀窍是,你不能直接用训练集来测试模型的能力,因为它会把答案背下来。

这就像你想教一个小学生加法,教一加一,考一加一,你不知道他是背的还是真会了;教一加一,考二十三加十九,才能验证是不是真会了。

所谓的过拟合就是指当测试题的答案模型已经背过了的时候,测出来的分数就会虚高。

刘大海组织了一下语言,回答道:“郑总,这事儿我也想过,但是应该不太能够。昨天测试的那三道题,来源都不一样,除了第一个道题是鼎盛内部题库里的,有可能泄露出去了,另外的两道题,第二题是我昨天现挂的,第三题是我的私人题库,公司里都没几个人见过。从这个角度来说,提前准备过的概率实在是太低了。”

说完他咂了下嘴,说话的语气里混杂着钦佩和不甘心:“咋说呢,这个85的意图理解,就算有虚高,比坤元要领先一下是肯定的。”

听了刘大海的话,郑晓波沉默了一会儿。

坐在对面的刘大海和程远都不敢说话,眼观鼻、鼻观心,坐在那儿一动不动,如同两个入定的老僧。

终于,郑晓波开口说道:“你们觉得这个技术值得投资吗?”

“值得,太值得了。”刘大海脱口而出。

作为一个纯粹的技术人,实事求是是第一位的,刘大海不会因为东西是别人做出来的就故意贬低它。

程远犹豫了一下,没说话,他还拿不准郑总的意思。

郑晓波又接着问道:“大海,他们是怎么做到的,你有什么想法吗?”

刘大海伸出手摸了摸他的光头,缓缓说道:“郑总,不瞒您说,我昨天晚上几乎一宿没睡,一直在想这个事儿。”

程远瞟了他一眼,心想,技术人的邀功还是直白了一点儿哈。

刘大海接着说道:“我自己想了几个方向,我觉得他们没跑出Transformer的架构,而且他们拿出来的又是一个小模型。现在这个阶段,能在模型的性能上有这么大的提升,要么是大参数,要么就是有质量特别高的数据,没有第三条路了。”

“大参数可以最先排除掉,他们来要的就是算力,这方面肯定不占优势。”

“意图理解这条赛道,OpenAI的GPT现在是公认的天花板,也就78分出头。他拿一个开源的7B架构,参数量只有人家的零头,跑出85.2。郑总,这么跟您说吧,这就好比一个我们那县城中学的一个学生,高考分数比全省状元还高三十分。”

刘大海一边说一边仔细观察郑晓波的表情。

技术人给领导汇报,又怕说多了太多技术细节,领导听不懂。又怕说得太少太简略,领导觉得不满意。只能小心翼翼,随时调整。

“我能想到唯一的解释,除非这个县城学生用的根本不是普通的课本,而是一份全世界别的学生都没有的,黄金复习资料。”

程远插了句话。

他没听懂,这没关系,但他主要是怕郑总也没听懂,这种问题不能让郑总来问。

“刘博士,不好意思,你这个比喻指的是?”

“是标注数据。”刘大海也意识到自己说上头了,赶紧扯回来,“郑总您应该了解,我就简单说一下。”

“咱们做模型训练呢,主要分这么几个阶段,先是预训练,这个阶段就是堆语料,恨不得把互联网上所有的东西都给它整进去。”

“这第二步呢,是监督微调,第一步训练出来的模型是好坏不分的,这个微调相当于是给它看作文范文,教它学明白啥是好赖话儿。”

“再往后还有个对齐阶段,这个咱们先不聊了。”

刘大海说到这,叹了口气,继续说道:“郑总,咱们做乾元的时候,就是占了数据量特别大的便宜,所以出来的效果好。现在做通用模型,大家用的语料都差不多,互联网就那么多东西,你抓我也抓。真想要拉开差距,还是得在后训练的阶段。”

“所以我说,那个……对方效果能做的这么好,一定是有好的标注数据。”

刘大海把韩路一的名字忘了,公司名字也忘了,只好中途改口。

不行,一会回去得查查这个公司,那个叫赵文渊的技术负责人,看看他的论文。

做出训练出这种水平的模型,不可能在学术界默默无闻的。

一直听着刘大海讲述,沉默不语的郑晓波突然开口说道:“Scale AI。”

此章为VIP章节,需要订阅后才能继续阅读

  • 价格:0屋币(1元=100屋币)
  • 购买
设置
作品详情 加书架
章节进度
评论 (0条)
评论加载中...
首富从AI浪潮开始封面 正序
目录加载中...
加书架
上一章 目录 下一章

设置