第三百八十四章 双标
第三百八十四章 双标 (第1/2页)与此同时,新加坡,aifoundation在新加坡国立大学人工智慧研究所临时租用的测评中心。
研究员、教授林伟伦正皱着眉头盯着屏幕上的测评结果。
他是一个新加坡华裔,也是这次新加坡人工智慧大会,新加坡国立大学作为合作方的负责人。
「汤圆1.0为什麽没在结果名单里?」林伟伦问旁边的同事。
同事也是个华裔面孔,操着一口新加坡英语:「额,好像是被委员会拿掉了。」
「为什麽?」林伟伦奇怪地问道。
同事摇了摇头:「这是他们的测评,可能是有什麽原因吧,我不清楚。」
林伟伦站起身。
「这可不是他们的测评,新加坡国立也是参与了的,他们不能无视我们的意见。」
说完他走了出去。
半个多小时後,在aifoundations与合作方的联合会议上,林伟伦提出了同样的问题。
「汤圆1.0为什麽没在结果名单里?」坐在林伟伦对面的是理察·科尔曼,一个满脸皱纹白发苍苍的老人。
理察现在担任aifoundations的轮值主席,同时他本人也在mit担任计算机科学教授,在业内德高望重。
理察把眼镜摘下来,从上衣兜里取出一块眼镜布擦了擦,然後把眼镜布收好,把眼镜戴了回去。
等他慢条斯理的把这些动作做完,才开口回答林伟伦的问题。
「林教授,这是委员会共同的决定。」理察说道。
「据我所知,委员会共同决定了两次。」林伟伦站起身,举起手中列印记录,上面写着最近几个小时之内委员会发的两封内部邮件。
第一封是在盲测阶段刚刚结束的时候,这个时候所有的模型都经过匿名处理,所有人能看到的结果只有一款模型的测试分数异常的高,远远超过了其他模型。
邮件内容是:「编号为1042的模型表现极佳,建议进行覆核检查。」
第二封则是在几小时之後,模型匿名解除,证实1042是由源智科技提交的汤圆1.0模型。
委员会发出的邮件内容已经变成了:「高度怀疑汤圆1.0模型通过非技术手段进行了作弊,已决定将汤圆1.0模型的成绩进行作废处理。汤圆0.9模型的成绩可以保留。」
林伟伦晃了晃手中的纸,问道:「在匿名阶段,处理决定是进行覆核检查;等到身份解盲之後,就变成了作废处理。我想知道这背後的理由是什麽?」
「自然是因为我们掌握了更多的信息。」理察淡定地回答道。「更多的信息是厂商的名字吗?」林伟伦的语气略显讥讽,因为他真的觉得这个问题非常荒诞。
「这是一部分有用的信息。」理察并没有觉得这里面有什麽不对,他神色认真地说道,「我们对中国厂商都有所了解,现实情况就是,中国的大模型厂商在公开排行榜上有非常强的优化动机。你也看到了,这个来自中国的模型分数极为异常,我们都有理由相信这个测试结果是不准确的。」
只是分高就是不准确?
林伟伦「嘿」了一声:「如果测试结果不准确的话,难道不是所有的模型测试结果都不准确吗?为什麽单独剔除这一个模型?」
「这套测试题是多家机构和专家联合设计的,我认为作为最新的、评价现行模型的标准,是很有价值的——只要剔除掉明显作弊的模型就可以了。」
林伟伦环视了一圈坐在会议室里的代表,aifoundations的成员单位大部分都来自於美国,这里大部分的代表也都来自於美国。
对这个结果,没有一个代表提出不同的意见。
他感到自己刚刚经历了一场学术霸凌。
虽然这个霸凌不是针对他本人的。
「那麽,」林伟伦继续说道,「这样一套经过严密设计的测试题,他们是怎麽作弊的?」
理察看向林伟伦。
「我没想到你会问出这个问题,林教授。」他说道,话里意有所指,「一个模型的成绩异常的高,自然是因为提前进行了针对性的训练,我认为,可能有aifoundations的合作单位把这套本应视为机密的测试题进行了泄露。」这场人工智慧大会新加坡站,aifoundations的合作单位只有两家,新加坡国立大学和新加坡国家ai研究院,这个指责指向谁,不言而喻。
(本章未完,请点击下一页继续阅读)