Google стартира първата двойно-сляпа оценка на собствен AI модел, за да предотврати замърсяването на бенчмарковете и да гарантира целостта на тестването. Този процес използва криптографски защитени среди, за да гарантира, че моделите не познават тестовите заявки предварително, осигурявайки точна оценка на истинските им способности.