4小说网 > 首富从看见信息面板开始 > 第三百八十四章 双标
加入书架推荐本书

第三百八十四章 双标

小说:首富从看见信息面板开始作者:路大头字数:3522更新时间 : 2026-08-12 00:19:19
    与此同时,新加坡,ai foundation在新加坡国立大学人工智慧研究所临时租用的测评中心。

    研究员、教授林伟伦正皱着眉头盯着屏幕上的测评结果。

    他是一个新加坡华裔,也是这次新加坡人工智慧大会,新加坡国立大学作为合作方的负责人。

    「汤圆1.0为什麽没在结果名单里?」林伟伦问旁边的同事。

    同事也是个华裔面孔,操着一口新加坡英语:「额,好像是被委员会拿掉了。」

    「为什麽?」林伟伦奇怪地问道。

    同事摇了摇头:「这是他们的测评,可能是有什麽原因吧,我不清楚。」

    林伟伦站起身。

    「这可不是他们的测评,新加坡国立也是参与了的,他们不能无视我们的意见。」

    说完他走了出去。

    半个多小时後,在ai foundations与合作方的联合会议上,林伟伦提出了同样的问题。

    「汤圆1.0为什麽没在结果名单里?」坐在林伟伦对面的是理察·科尔曼,一个满脸皱纹白发苍苍的老人。

    理察现在担任ai foundations的轮值主席,同时他本人也在mit担任计算机科学教授,在业内德高望重。

    理察把眼镜摘下来,从上衣兜里取出一块眼镜布擦了擦,然後把眼镜布收好,把眼镜戴了回去。

    等他慢条斯理的把这些动作做完,才开口回答林伟伦的问题。

    「林教授,这是委员会共同的决定。」理察说道。

    「据我所知,委员会共同决定了两次。」林伟伦站起身,举起手中列印记录,上面写着最近几个小时之内委员会发的两封内部邮件。

    第一封是在盲测阶段刚刚结束的时候,这个时候所有的模型都经过匿名处理,所有人能看到的结果只有一款模型的测试分数异常的高,远远超过了其他模型。

    邮件内容是:「编号为1042的模型表现极佳,建议进行覆核检查。」

    第二封则是在几小时之後,模型匿名解除,证实1042是由源智科技提交的汤圆1.0模型。

    委员会发出的邮件内容已经变成了:「高度怀疑汤圆1.0模型通过非技术手段进行了作弊,已决定将汤圆1.0模型的成绩进行作废处理。汤圆0.9模型的成绩可以保留。」

    林伟伦晃了晃手中的纸,问道:「在匿名阶段,处理决定是进行覆核检查;等到身份解盲之後,就变成了作废处理。我想知道这背後的理由是什麽?」

    「自然是因为我们掌握了更多的信息。」理察淡定地回答道。「更多的信息是厂商的名字吗?」林伟伦的语气略显讥讽,因为他真的觉得这个问题非常荒诞。

    「这是一部分有用的信息。」理察并没有觉得这里面有什麽不对,他神色认真地说道,「我们对中国厂商都有所了解,现实情况就是,中国的大模型厂商在公开排行榜上有非常强的优化动机。你也看到了,这个来自中国的模型分数极为异常,我们都有理由相信这个测试结果是不准确的。」

    只是分高就是不准确?

    林伟伦「嘿」了一声:「如果测试结果不准确的话,难道不是所有的模型测试结果都不准确吗?为什麽单独剔除这一个模型?」

    「这套测试题是多家机构和专家联合设计的,我认为作为最新的、评价现行模型的标准,是很有价值的——只要剔除掉明显作弊的模型就可以了。」

    林伟伦环视了一圈坐在会议室里的代表,ai foundations的成员单位大部分都来自於美国,这里大部分的代表也都来自於美国。

    对这个结果,没有一个代表提出不同的意见。

    他感到自己刚刚经历了一场学术霸凌。

    虽然这个霸凌不是针对他本人的。

    「那麽,」林伟伦继续说道,「这样一套经过严密设计的测试题,他们是怎麽作弊的?」

    理察看向林伟伦。

    「我没想到你会问出这个问题,林教授。」他说道,话里意有所指,「一个模型的成绩异常的高,自然是因为提前进行了针对性的训练,我认为,可能有ai foundations的合作单位把这套本应视为机密的测试题进行了泄露。」这场人工智慧大会新加坡站,ai foundations的合作单位只有两家,新加坡国立大学和新加坡国家ai研究院,这个指责指向谁,不言而喻。

    林伟伦气极反笑。

    以他的权限,他只能看到分数结果,却对测试里的内容一无所知。

    合作方唯一能接触到的信息是内部公告和关於会议议程、测试流程的一些统一邮件。

    偷测试集,他难道是商业间谍吗?如果是的话,他直接偷模型不好吗,为什麽要去偷一个没什麽用的测试集?

    现在理察不仅要作废排名第一的测试结果,还要把提前泄露考题的黑锅扣在他身上?

    林伟伦冷笑了一声,说道:「科尔曼教授,你的指责令人发笑,如果你执意要执行这样的决定的话,我会代表新加坡国立大学退出这次合作。」

    林伟伦说这话只是在虚张声势,他只是个教授,不是校长,更不姓李。他完全因为专业对口担任合作方的负责人,根本没有权利决定退出合作。

    理察果然没被吓到,他微微一笑:「林教授,请便吧。」

    林伟伦没等到会议结束就直接走出了会议室,一路回到自己的办公室。

    回到办公室之後,他又拿出测试结果的分数看了一遍。

    以往的模型测试集主要集中在测试知识、数学能力、编程能力、理解能力和推理能力之类的方向。但是因为智能体应用最近的爆火,ai foundations这一次的测试集特意注重了长程任务的能力,而且占比极高,总分一百分的测试题中有三十五分是与长程任务的管理有关的。

    当然,这里说的分并不是像学生考试做卷子一样,四个选项里蒙一个,对了就拿分。具体的测试过程相当复杂,每一题都要完成一个跨度长达几个小时、进行很多个步骤才能完成的任务,最後成功之後才能拿到一分,有时甚至要重复多次来验证稳定性,取平均分。

    在这样的新标准下,现在的公开模型评分普遍不算太高。

    之前霸榜了很久的汤圆0.9只有70.2分。

    gemini的新模型最终得分70.8分,openai的gpt-v-ii最终得分71.7。

    分数第二高的金星模型2.0得分是72.3分。

    互相之间咬的很紧。

    只有汤圆1.0,得分93.5,比第二名领先了二十多分。

    说实话,这种程度的领先,林伟伦也不理解。

    但正是因为不理解,他更不能接受理察等人毫无理由的打压。打不过就修改规则?这些傲慢的西方人。

    林伟伦翻看起了源智科技来参会成员的联系方式,他决定等对方到了之後,亲自过去交流一下。

    至少要让他们知道自己所受到的不公正待遇。如果他们需要帮助的话,林伟伦也做好了准备。

    另外一边,理察刚刚接通和矽谷的电话。

    电话那边的是nexus ai的ceo瑞恩。

    「测试成绩你看到了吗?」理察一边喝红茶一边说道,「恭喜你啊,瑞恩,这次你可是堂堂正正的打败了山姆。」

    「看到了,还要多亏了老师你的指点。」瑞恩说道。

    在他的学术生涯中,瑞恩曾经和理察有过友好的学习关系,这个关系一直保留了下来,在他的创业过程中也起到了很大的帮助。

    就拿这次来说,如果没有理察在大方向上的指点,甚至指出了某些极为具体的技术挑战,金星2.0的研究方向肯定也会优化长程任务,但是出来的效果能不能有现在这麽好,瑞恩也不敢保证。

    「很好,听说mcp最近的推广也很有成效,我为你自豪。」理察在电话里笑了两声,「期待在新加坡见到你展示你的最新成果。我知道,你的对手,那个汤圆协议公司的人也会来,但是你放心,你会得到我的支持。」

    理察没提汤圆1.0的事。

    毕竟他是真心认为,这个模型是作弊了,大部分顶级模型之间的差距都在一两分之间,这个模型一次高出二十分去,除了作弊他想不到别的原因。

    虽然理察也没想出他们是怎麽作弊的,但这不重要。

    电话挂断之後,瑞恩靠在老板椅的椅背上,把双脚翘上了办公桌的桌面,同时鼻子里哼起了义大利小曲。nexus ai的最新模型能力超过了openai的最新模型。

    值得纪念的一天。

    什麽叫技术储备啊?这就是技术储备!

  请记住本书首发域名:www.8xiaoshuo.net。4小说网手机版阅读网址:wap.8xiaoshuo.net