Un grupo de investigadores iraníes ha puesto a prueba a tres asistentes de inteligencia artificial con un cuestionario real de química que se usa en un departamento de salud ambiental y laboral. El resultado es tan interesante por lo que muestra como por lo que no: los modelos aciertan con bastante soltura cuando la pregunta es directa, pero se tambalean cuando hay que localizar la opción incorrecta, y hay diferencias notables entre unos y otros. Gemini 3 se lleva la mejor nota, ChatGPT-5.5 queda en una posición intermedia y Copilot cierra la clasificación con una capacidad muy limitada para descartar respuestas falsas. Repasamos qué se midió, cómo se analizaron los datos, qué dicen otros estudios parecidos y qué precauciones conviene tomar antes de convertir estas cifras en una clasificación definitiva de los asistentes.
Un examen de verdad, en persa y con fórmulas
El trabajo se ha publicado en Scientific Reports y lo firman investigadores de la Universidad de Ciencias Médicas de Birjand, en Irán. Los autores partieron de un cuestionario de 50 preguntas de opción múltiple que se emplea con fines docentes en una asignatura de química del departamento de salud ambiental y laboral, un campo que históricamente ha evolucionado muy ligado a la química. El texto estaba redactado sobre todo en persa, con algunos términos en inglés y fórmulas, lo que añade una dificultad extra respecto a los tests habituales, que suelen venir en inglés.
Los modelos evaluados fueron ChatGPT-5.5, Gemini 3 y Copilot 2026. Para valorar su rendimiento, los investigadores recurrieron al análisis mediante matriz de confusión, una herramienta clásica del aprendizaje automático que cruza las respuestas dadas con las correctas y permite calcular tres magnitudes. La sensibilidad refleja, en líneas generales, la capacidad de reconocer lo que es correcto; la especificidad, la de descartar lo que es incorrecto; y la exactitud global resume el porcentaje de aciertos. Para comparar los modelos entre sí aplicaron además la prueba Q de Cochran, la prueba de McNemar para las comparaciones por parejas y la correlación biserial puntual para ver si las características de cada pregunta influían en los aciertos.
Los resultados: Gemini 3 por delante
Las cifras medias de los tres modelos fueron una sensibilidad de 0,81, una especificidad de 0,29 y una exactitud de 0,68. Dicho de otro modo, los asistentes identifican bastante bien lo correcto, pero fallan con frecuencia al rechazar lo erróneo. Si se traslada la exactitud media a un examen de 50 preguntas, equivale aproximadamente a 34 aciertos.
Por modelos, Gemini 3 fue el más sólido, con una sensibilidad de 0,85, una especificidad de 0,56 y una exactitud de 0,80, lo que equivale a unos 40 aciertos sobre 50. ChatGPT-5.5 tuvo la sensibilidad más baja del grupo, 0,76. Copilot, por su parte, registró una especificidad de apenas 0,07, es decir, solo descartó correctamente alrededor de siete de cada cien opciones falsas, y se quedó en una exactitud de 0,62. La distancia entre el primero y el último, 18 puntos porcentuales, se traduce en unas nueve preguntas de diferencia en un test de este tamaño, nada despreciable para un examen académico.
El talón de Aquiles: las preguntas formuladas en negativo
El hallazgo más llamativo es que no se encontraron correlaciones significativas entre el rendimiento y las características del cuestionario, con una excepción clara: todos los modelos lo hicieron mal en las preguntas planteadas en negativo, aquellas que piden identificar la opción incorrecta. Es un resultado que cuadra con lo que sabemos del funcionamiento de estos sistemas. Un modelo de lenguaje genera la respuesta más plausible a partir de patrones estadísticos, y encontrar lo verdadero encaja mejor con esa lógica que invertir el razonamiento y buscar lo falso. Además, en un enunciado del tipo «señale la afirmación incorrecta» basta con que el modelo ignore la negación para elegir justo la opción contraria a la deseada.
Este detalle encaja con la baja especificidad que se observa en el conjunto. Un asistente que tiende a validar lo que le suena razonable y rara vez contradice puede dar la impresión de dominar la materia, pero se queda corto cuando el trabajo consiste en detectar el error. Para un docente o un estudiante que use estas herramientas, la lección práctica es evidente: conviene verificar con más cuidado las respuestas a preguntas del tipo «cuál de las siguientes es falsa».
Lo que dicen otros estudios similares
El trabajo no está aislado. Pocos días antes, el mismo grupo publicó una comparación parecida en farmacología, con el mismo formato de 50 preguntas en persa. Allí se evaluaron ChatGPT-5.5, Gemini 3.1 y Claude 4.6. Las sensibilidades fueron de 1,00, 0,94 y 0,90, las especificidades de 0,43, 0,50 y 0,35, y la exactitud de 0,82 para los dos primeros y 0,72 para el tercero. De nuevo se observa el mismo patrón: sensibilidad alta y especificidad mucho más baja. Los autores detectaron además un descenso estadísticamente significativo del rendimiento de ChatGPT-5.5 y Gemini 3.1 en las preguntas cuantitativas, con un coeficiente φ de −0,286 y p inferior a 0,05.
El problema de los cálculos aparece con más crudeza en otro trabajo sobre dosificación de medicamentos. Los investigadores prepararon 90 enunciados de dificultad creciente, los pasaron a tres modelos y obtuvieron 270 respuestas que dos revisores clínicos valoraron con un criterio estricto: se consideraba correcta una desviación de hasta el 5 %, menor entre el 5 y el 10 %, y grave por encima del 10 %. Gemini y DeepSeek acertaron el 100 % de los casos, mientras que ChatGPT se quedó en el 83,3 % global y cayó hasta el 53,3 % en los ejercicios avanzados. Las alucinaciones se concentraron en ese último modelo, con un 16,7 % de métodos de cálculo incorrectos, un 15,6 % de errores aritméticos y un 4,4 % de razonamientos defectuosos. Los autores recomiendan que un profesional cualificado verifique siempre estos cálculos antes de aplicarlos en la práctica clínica.
Cómo leer estos números con prudencia
Conviene no sacar conclusiones demasiado rotundas. Con solo 50 preguntas, el margen de error es amplio: aplicando la fórmula habitual, un intervalo de confianza del 95 % para una exactitud de 0,68 rondaría los 13 puntos arriba y abajo, y para 0,80 unos 11. Eso significa que diferencias de pocos puntos entre modelos no son concluyentes, y que ni siquiera la brecha entre Gemini 3 y Copilot se puede considerar blindada sin el análisis de McNemar que los autores realizaron. Los propios investigadores hablan de resultados preliminares y piden más estudios.
Hay otros matices. El cuestionario está en persa, de modo que los datos no son extrapolables sin más a un examen en español. Además, las versiones de los modelos cambian cada pocas semanas y los resultados de hoy pueden no valer dentro de un trimestre. Por último, medir con un único test de opción múltiple capta solo una parte de lo que un asistente puede aportar en un aula o en un laboratorio, donde también cuentan la explicación, el razonamiento paso a paso y la capacidad de reconocer lo que no se sabe.
Reflexiones adicionales
Más allá de quién gane la clasificación, lo que me parece útil de este tipo de estudios es que dejan por escrito una intuición que muchos usuarios ya tenían: estos asistentes son buenos confirmando y bastante peores contradiciendo. Para quien los use como apoyo de estudio, eso sugiere un hábito sencillo, que es pedirles que justifiquen la respuesta y contrastar siempre las preguntas con enunciado negativo y los cálculos numéricos con una fuente fiable. Para quien enseña, abre otra posibilidad interesante: diseñar exámenes que incluyan preguntas de detectar el error, precisamente porque son las que más ponen a prueba tanto a los alumnos como a las máquinas.
También cabe esperar que la próxima generación de modelos mejore justo en esos puntos débiles, ya que el razonamiento paso a paso y la verificación de resultados son líneas de trabajo muy activas. Mientras tanto, la conclusión razonable es tratar a los asistentes como un compañero de estudio capaz y rápido, pero que necesita revisión, sobre todo en materias donde un error de concepto o de cálculo tiene consecuencias reales, como la química, la salud laboral o la farmacología.
1