书海阁
书架 邀请 登录

第三百八十四章 双标

作者:路大头字数:3.3千字更新时间:2026-09-27 14:23:24
第三百八十四章 双标

与此同时,新加坡,AI Foundation在新加坡国立大学人工智能研究所临时租用的测评中心。

研究员、教授林伟伦正皱着眉头盯着屏幕上的测评结果。

他是一个新加坡华裔,也是这次新加坡人工智能大会,新加坡国立大学作为合作方的负责人。

“汤圆1.0为什么没在结果名单里?”林伟伦问旁边的同事。

同事也是个华裔面孔,操着一口新加坡英语:“额,好像是被委员会拿掉了。”

“为什么?”林伟伦奇怪地问道。

同事摇了摇头:“这是他们的测评,可能是有什么原因吧,我不清楚。”

林伟伦站起身。

“这可不是他们的测评,新加坡国立也是参与了的,他们不能无视我们的意见。”

说完他走了出去。

半个多小时后,在AI Foundations与合作方的联合会议上,林伟伦提出了同样的问题。

“汤圆1.0为什么没在结果名单里?”

坐在林伟伦对面的是理查德·科尔曼,一个满脸皱纹白发苍苍的老人。

理查德现在担任AI Foundations的轮值主席,同时他本人也在MIT担任计算机科学教授,在业内德高望重。

理查德把眼镜摘下来,从上衣兜里取出一块眼镜布擦了擦,然后把眼镜布收好,把眼镜戴了回去。

等他慢条斯理的把这些动作做完,才开口回答林伟伦的问题。

“林教授,这是委员会共同的决定。”理查德说道。

“据我所知,委员会共同决定了两次。”林伟伦站起身,举起手中打印记录,上面写着最近几个小时之内委员会发的两封内部邮件。

第一封是在盲测阶段刚刚结束的时候,这个时候所有的模型都经过匿名处理,所有人能看到的结果只有一款模型的测试分数异常的高,远远超过了其他模型。

邮件内容是:「编号为1042的模型表现极佳,建议进行复核检查。」

第二封则是在几小时之后,模型匿名解除,证实1042是由源智科技提交的汤圆1.0模型。

委员会发出的邮件内容已经变成了:「高度怀疑汤圆1.0模型通过非技术手段进行了作弊,已决定将汤圆1.0模型的成绩进行作废处理。汤圆0.9模型的成绩可以保留。」

林伟伦晃了晃手中的纸,问道:“在匿名阶段,处理决定是进行复核检查;等到身份解盲之后,就变成了作废处理。我想知道这背后的理由是什么?”

“自然是因为我们掌握了更多的信息。”理查德淡定地回答道。

“更多的信息是厂商的名字吗?”林伟伦的语气略显讥讽,因为他真的觉得这个问题非常荒诞。

“这是一部分有用的信息。”理查德并没有觉得这里面有什么不对,他神色认真地说道,“我们对中国厂商都有所了解,现实情况就是,中国的大模型厂商在公开排行榜上有非常强的优化动机。你也看到了,这个来自中国的模型分数极为异常,我们都有理由相信这个测试结果是不准确的。”

只是分高就是不准确?

林伟伦“嘿”了一声:“如果测试结果不准确的话,难道不是所有的模型测试结果都不准确吗?为什么单独剔除这一个模型?”

“这套测试题是多家机构和专家联合设计的,我认为作为最新的、评价现行模型的标准,是很有价值的——只要剔除掉明显作弊的模型就可以了。”

林伟伦环视了一圈坐在会议室里的代表,AI Foundations的成员单位大部分都来自于美国,这里大部分的代表也都来自于美国。

对这个结果,没有一个代表提出不同的意见。

他感到自己刚刚经历了一场学术霸凌。

虽然这个霸凌不是针对他本人的。

“那么,”林伟伦继续说道,“这样一套经过严密设计的测试题,他们是怎么作弊的?”

理查德看向林伟伦。

“我没想到你会问出这个问题,林教授。”他说道,话里意有所指,“一个模型的成绩异常的高,自然是因为提前进行了针对性的训练,我认为,可能有AI Foundations的合作单位把这套本应视为机密的测试题进行了泄露。”

这场人工智能大会新加坡站,AI Foundations的合作单位只有两家,新加坡国立大学和新加坡国家AI研究院,这个指责指向谁,不言而喻。

林伟伦气极反笑。

以他的权限,他只能看到分数结果,却对测试里的内容一无所知。

合作方唯一能接触到的信息是内部公告和关于会议议程、测试流程的一些统一邮件。

偷测试集,他难道是商业间谍吗?如果是的话,他直接偷模型不好吗,为什么要去偷一个没什么用的测试集?

现在理查德不仅要作废排名第一的测试结果,还要把提前泄露考题的黑锅扣在他身上?

林伟伦冷笑了一声,说道:“科尔曼教授,你的指责令人发笑,如果你执意要执行这样的决定的话,我会代表新加坡国立大学退出这次合作。”

林伟伦说这话只是在虚张声势,他只是个教授,不是校长,更不姓李。他完全因为专业对口担任合作方的负责人,根本没有权利决定退出合作。

理查德果然没被吓到,他微微一笑:“林教授,请便吧。”

林伟伦没等到会议结束就直接走出了会议室,一路回到自己的办公室。

回到办公室之后,他又拿出测试结果的分数看了一遍。

以往的模型测试集主要集中在测试知识、数学能力、编程能力、理解能力和推理能力之类的方向。

但是因为智能体应用最近的爆火,AI Foundations这一次的测试集特意注重了长程任务的能力,而且占比极高,总分一百分的测试题中有三十五分是与长程任务的管理有关的。

当然,这里说的分并不是像学生考试做卷子一样,四个选项里蒙一个,对了就拿分。具体的测试过程相当复杂,每一题都要完成一个跨度长达几个小时、进行很多个步骤才能完成的任务,最后成功之后才能拿到一分,有时甚至要重复多次来验证稳定性,取平均分。

在这样的新标准下,现在的公开模型评分普遍不算太高。

之前霸榜了很久的汤圆0.9只有70.2分。

Gemini的新模型最终得分70.8分,OpenAI的GPT-V-II最终得分71.7。

分数第二高的金星模型2.0得分是72.3分。

互相之间咬的很紧。

只有汤圆1.0,得分93.5,比第二名领先了二十多分。

说实话,这种程度的领先,林伟伦也不理解。

但正是因为不理解,他更不能接受理查德等人毫无理由的打压。打不过就修改规则?这些傲慢的西方人。

林伟伦翻看起了源智科技来参会成员的联系方式,他决定等对方到了之后,亲自过去交流一下。

至少要让他们知道自己所受到的不公正待遇。

如果他们需要帮助的话,林伟伦也做好了准备。

另外一边,理查德刚刚接通和硅谷的电话。

电话那边的是Nexus AI的CEO瑞恩。

“测试成绩你看到了吗?”理查德一边喝红茶一边说道,“恭喜你啊,瑞恩,这次你可是堂堂正正的打败了山姆。”

“看到了,还要多亏了老师你的指点。”瑞恩说道。

在他的学术生涯中,瑞恩曾经和理查德有过友好的学习关系,这个关系一直保留了下来,在他的创业过程中也起到了很大的帮助。

就拿这次来说,如果没有理查德在大方向上的指点,甚至指出了某些极为具体的技术挑战,金星2.0的研究方向肯定也会优化长程任务,但是出来的效果能不能有现在这么好,瑞恩也不敢保证。

“很好,听说MCP最近的推广也很有成效,我为你自豪。”理查德在电话里笑了两声,“期待在新加坡见到你展示你的最新成果。我知道,你的对手,那个汤圆协议公司的人也会来,但是你放心,你会得到我的支持。”

理查德没提汤圆1.0的事。

毕竟他是真心认为,这个模型是作弊了,大部分顶级模型之间的差距都在一两分之间,这个模型一次高出二十分去,除了作弊他想不到别的原因。

虽然理查德也没想出他们是怎么作弊的,但这不重要。

电话挂断之后,瑞恩靠在老板椅的椅背上,把双脚翘上了办公桌的桌面,同时鼻子里哼起了意大利小曲。

Nexus AI的最新模型能力超过了OpenAI的最新模型。

值得纪念的一天。

什么叫技术储备啊?这就是技术储备!

此章为VIP章节,需要订阅后才能继续阅读

  • 价格:0屋币(1元=100屋币)
  • 购买
设置
作品详情 加书架
章节进度
评论 (0条)
评论加载中...
首富从AI浪潮开始封面 正序
目录加载中...
加书架
上一章 目录 下一章

设置