A construção do dataset e a metodologia de treinamento, que haviam evoluído de forma ligeiramente diferente entre famílias de modelos, foram unificadas em uma única abordagem canônica, auditada contra vazamentos. Isso reduziu o risco de que dois modelos estivessem sendo silenciosamente comparados sob dois conjuntos diferentes de regras.