Lo que sabemos
Zhipu, que comercializa sus productos bajo la marca Z.ai, ha publicado resultados que dicen que su nuevo GLM-5.3 casi igualó al Mythos 5 de Anthropic en las pruebas de ciberdefensa de CyberGym, y esas afirmaciones fueron reportadas por Reuters y recogidas por varios otros medios.4Respaldado por 4 fuentesReutersCNAeconomictimes.indiatimes.comthestandard.com.hk Los números publicados por Zhipu muestran una estrecha ventaja de 0.7 puntos para GLM-5.3 en una métrica de seguridad de CyberGym, pero un déficit mucho mayor (alrededor de 23.6 puntos) en una prueba de explotación más difícil, y los analistas han señalado que la cifra de 0.7 proviene de la autoevaluación de Zhipu mientras el modelo aún no se lanza de forma abierta.2Respaldado por 2 fuentestheclarity.todayReuters
La cobertura centrada en seguridad y los informes de la industria dicen que GLM-5.3 es un modelo centrado en la codificación que mostró un desarrollo de habilidades cibernéticas más rápido de lo esperado en las cuentas de Zhipu, pero también enfatizan que las diferencias en el diseño de las pruebas, la ausencia de pesos abiertos o verificación independiente total, y resultados mixtos en las subpruebas limitan cuán concluyentemente se pueden comparar hoy los modelos.2Respaldado por 2 fuentestheclarity.todayReuters
Comparación de fuentes
Cobertura coincidenteCorrobora
- Reuters↗Respalda que Reuters informó la afirmación de Zhipu de que GLM-5.3 casi igualó al Mythos 5 de Anthropic en la evaluación de CyberGym.
- CNA↗Confirma que CNA publicó el mismo informe que Zhipu dijo que GLM-5.3 se acercó al Mythos 5 de Anthropic en pruebas de ciberdefensa.
- theclarity.today↗Confirma que la ventaja de 0.7 puntos en CyberGym fue autoevaluada, que GLM-5.3 superó a Anthropic en una métrica, pero quedó rezagado por 23.6 puntos en una prueba de explotación más difícil, y que el modelo aún no se ha liberado abiertamente.
- economictimes.indiatimes.com↗Muestra que The Economic Times republicó el informe en el que Zhipu dijo que GLM-5.3 se acercó al Mythos 5 en pruebas de ciberdefensa de CyberGym.
- thestandard.com.hk↗Indica que hubo una cobertura adicional de prensa del informe que Zhipu dijo que GLM-5.3 se acercó al Mythos 5 de Anthropic en pruebas de ciberdefensa.