En el ensayo de Stanford, la IA que mejoró el aprendizaje nunca le habló al alumno: le habló al tutor

En el primer ensayo aleatorizado de un asistente de IA para tutores en vivo, los alumnos de los tutores que lo tenían tuvieron 4 puntos porcentuales más de probabilidad de dominar el tema del día que los del grupo de control, y 9 puntos más entre los tutores peor calificados (Wang y coautores, Stanford, 2024).

Casi toda conversación sobre inteligencia artificial y educación se hace la misma pregunta: ¿va a sustituir la IA al profesor? Es la pregunta que más miedo genera, y el estudio con el diseño más riguroso que conozco sobre IA y tutoría no la contesta, porque no es la que se hizo. Ese estudio no midió qué pasa cuando se pone un asistente de IA frente al alumno. Midió qué pasa cuando se pone al lado del docente, en el segundo exacto en que un alumno se equivoca.

Soy Pratosh Dwivedi, cofundador y director de tecnología de TecnIA. Diseño la parte tecnológica de una universidad que apuesta por la inteligencia artificial, y este es uno de los pocos temas donde la evidencia pesa más que el discurso.

¿Qué hizo exactamente el estudio, y qué encontró?

Tutor CoPilot es un botón que un tutor activa a media sesión: el propio tutor elige qué tipo de ayuda necesita (dar una pista, mostrar un ejemplo resuelto, hacer una corrección menor, simplificar la pregunta, entre otras opciones) y el sistema le redacta a él, nunca al alumno, una sugerencia que puede editar, regenerar o descartar. Investigadoras de Stanford lo probaron con el primer ensayo aleatorizado controlado hecho sobre un sistema así en tutoría en vivo: los alumnos de los tutores con acceso a la herramienta tuvieron 4 puntos porcentuales más de probabilidad de aprobar el ejercicio de salida de la sesión que los del grupo de control, de 62% a 66%, con significancia estadística (p menor a 0.01).

El ensayo asignó al azar a 900 tutores para trabajar con 1,800 estudiantes de primaria y secundaria de comunidades históricamente desatendidas en Estados Unidos, en sesiones de matemáticas dentro de su propia escuela, con el proveedor de tutorías FEV Tutor. La herramienta nunca conversa con el alumno: toma los últimos mensajes de la conversación, con los nombres del tutor y del alumno ocultos, el tema de la lección y la estrategia elegida, y con eso redacta la sugerencia. Un matiz que las propias autoras reconocen entre sus limitaciones: el efecto se midió en el dominio del tema de cada sesión; en el examen estandarizado de fin de año no encontraron una mejora estadísticamente significativa, algo que atribuyen en parte a que el estudio duró solo dos meses.

Tarjetas del ensayo aleatorizado con 900 tutores y 1,800 estudiantes muestran +4 puntos · dominio del tema, +9 puntos · tutores peor calificados y +7 puntos · tutores con menos experiencia; otra dice Unos 20 dólares por tutor al año (proyectado). Fuente: Wang y coautores, Stanford, 2024.
Los resultados del primer ensayo aleatorizado de un copiloto de IA para tutores, publicado por investigadoras de Stanford en 2024; las ganancias están en puntos porcentuales.

¿Por qué el efecto fue mayor justo en los tutores con menos experiencia?

Porque ahí vive la brecha que la herramienta llena. En el mismo estudio, los tutores con la calificación de calidad más baja mejoraron el dominio de sus alumnos 9 puntos porcentuales, de 56% a 65%; los de menor experiencia, 7 puntos, de 61% a 68%. En ambos casos los alumnos de esos tutores terminaron al nivel, o por encima, de los alumnos de los tutores mejor calificados o más experimentados del grupo de control.

Un tutor con años encima ya sabe, casi de memoria, qué pregunta hacer cuando un alumno se traba en un problema. Uno nuevo todavía no. Lo que el estudio encontró, revisando más de 550,000 mensajes con clasificadores de lenguaje, es que los tutores con acceso a la herramienta usaron muchas más preguntas para guiar el pensamiento del alumno y recurrieron mucho menos a simplemente darle la respuesta o la estrategia de solución. Y el costo de uso del modelo fue bajo: unos 20 dólares por tutor al año, proyectado a partir de los dos meses del estudio, frente a los 3,300 dólares o más que cuestan los programas de formación docente tradicionales, según la misma comparación que hacen las autoras.

En México la escala del problema es comparable. La Secretaría de Educación Pública contabilizó 2,180,559 docentes en todo el sistema educativo nacional en el ciclo escolar 2024-2025, de los cuales 519,190 trabajan en educación superior. Formar a esa cantidad de personas, una por una, con acompañamiento experto en persona, es exactamente el problema de costo que describen las autoras para Estados Unidos. Lo digo como lectura mía, no como algo que el estudio mida: no encontré una réplica de este ensayo hecha en México o Latinoamérica, y prefiero decirlo así a dar a entender que ya se probó aquí.

Globos grises clasifican como Baja calidad · dar la respuesta, Baja calidad · dar la estrategia de solución y Baja calidad · Buen intento; los blancos sobre morado dicen Alta calidad · pedir que explique cómo llegó y Alta calidad · una pregunta que guíe. Clasificación de Wang y coautores, Stanford, 2024.
Ejemplos de respuestas de tutores, tres de baja calidad y dos de alta calidad, según la clasificación que usaron las autoras del estudio para analizar más de 550,000 mensajes.

¿Y si la IA no está en la sesión en vivo? ¿También ayuda ahí al docente?

Sí, aunque en una tarea distinta: la planeación de la clase. Un ensayo aleatorizado de la Education Endowment Foundation, con 259 docentes de ciencias en 68 escuelas de Inglaterra, encontró que quienes usaron ChatGPT para preparar sus lecciones, con una guía de uso, ahorraron 25.3 minutos de planeación por semana: 31% menos tiempo, de 81.5 a 56.2 minutos, sin que un panel externo de docentes detectara diferencia en la calidad del material que produjeron.

Son dos estudios que no se parecen entre sí: uno mide un instante de conversación en vivo, el otro una tarea de preparación fuera del salón. Lo que comparten es dónde pusieron la inteligencia artificial: al lado de quien enseña, ayudándolo en una tarea suya. Es la lectura que me interesa de los dos juntos, no una conclusión que ninguno de los dos haga por separado.

¿Qué hacemos en TecnIA con esto?

Es el tipo de evidencia que queremos que sepan leer quienes estudian nuestra Maestría en Tecnología Educativa e Inteligencia Artificial, un programa que, en palabras de su propia ficha pública, busca preparar líderes capaces de articular pedagogía, datos e inteligencia artificial para mejorar la calidad educativa. TecnIA Universidad Online opera 100% online, con siete programas que cuentan con Reconocimiento de Validez Oficial de Estudios.

La pregunta que me interesa no es cuánta inteligencia artificial cabe en un salón. Es esta: si tu institución pudiera darle a cada docente, en el momento exacto de duda frente a un error, la misma sugerencia que hoy solo tienen los profesores con más años encima, ¿a quién beneficiaría primero: al alumno que ya tiene un buen maestro, o al que todavía se está formando?

Si coordinas un cuerpo docente y quieres platicar cómo se vería esto en la práctica, escríbenos por WhatsApp y platicamos sin compromiso.

Preguntas frecuentes

¿Tutor CoPilot ya existe dentro de TecnIA?

No. Es un sistema construido y estudiado por investigadoras de la Universidad de Stanford junto con un proveedor de tutorías, FEV Tutor, en Estados Unidos. Lo citamos como evidencia de diseño pedagógico, no como una función de nuestra plataforma.

¿El estudio dice que la IA debe reemplazar la formación docente tradicional?

No lo interpreto así, aunque las autoras van más lejos que yo. Comparan su costo de uso, 20 dólares por tutor al año, con los 3,300 dólares o más por docente al año de los programas de formación tradicionales, y lo presentan como una alternativa escalable. Mi lectura es más prudente: dos meses de tutoría de matemáticas no bastan para dar por sustituida la formación de fondo.

¿El efecto de 4 o 9 puntos porcentuales aplica a un salón de clase normal con treinta alumnos?

No está medido ahí. El estudio se hizo en sesiones de tutoría remota de matemáticas que los alumnos tomaban dentro de su propia escuela, con un tutor dedicado a atenderlos, no en un salón con un solo docente frente a un grupo completo. Extender el tamaño exacto del efecto a otro contexto es una lectura, no un dato del estudio.

¿Hay algo parecido medido en México?

No que haya podido verificar: no encontré una réplica de este ensayo hecha en México o Latinoamérica. Lo que sí es mexicano y verificable es la escala del problema: según la Secretaría de Educación Pública, en el ciclo escolar 2024-2025 había 519,190 docentes en educación superior, de un total nacional de 2,180,559.

¿Qué sugiere exactamente el copiloto: la respuesta o algo más?

Una sugerencia para el tutor, no un mensaje para el alumno. El tutor elige qué tipo de ayuda quiere dar, por ejemplo una pista, un ejemplo resuelto o una pregunta más sencilla, y el sistema redacta la sugerencia sobre esa elección; el tutor la puede editar, regenerar o descartar antes de usarla. Lo que sí midió el estudio es el efecto: los tutores que tenían la herramienta hicieron más preguntas para guiar al alumno y le dieron la respuesta directa menos veces.


Pratosh Dwivedi, cofundador y Director de Tecnología de TecnIA Universidad

Pratosh Dwivedi es cofundador y Director de Tecnología de TecnIA Universidad Online, donde trabaja en el diseño de la plataforma académica y en la formación de quienes enseñan con inteligencia artificial.

Este artículo fue escrito por Pratosh Dwivedi con asistencia de herramientas de inteligencia artificial, conforme a nuestra Política de IA.