Saltar al contenido
IA y Educación 29 sep 2026

La IA ya no solo hace la tarea: ¿qué decisiones educativas estamos dispuestos a delegarle?

Por Daniela Buján, cofundadora de Auroria

Docente y estudiante revisan borradores con correcciones y conversan sobre el proceso de aprendizaje

Primero nos preocupó que la inteligencia artificial hiciera el trabajo de los alumnos. Después intentamos usar tecnología para descubrir cuándo había intervenido. Ahora la IA también empieza a corregir, puntuar y evaluar. El desafío ya no es solamente decidir cuándo usarla, sino qué información puede aportar y qué decisiones educativas deberían seguir necesitando contexto y criterio humano.

Durante los primeros años de inteligencia artificial generativa, una de las mayores preocupaciones de las escuelas fue bastante fácil de imaginar: un alumno utiliza IA para hacer un trabajo y un docente intenta descubrirlo.

Alrededor de esa escena construimos detectores, porcentajes de contenido generado por IA, sistemas de trazabilidad y nuevas reglas sobre qué usos estaban permitidos. Pero mientras todavía discutimos cómo saber qué hizo el alumno, la inteligencia artificial empieza a aparecer también del otro lado de la evaluación: ayudando a corregir trabajos, asignar puntuaciones, detectar irregularidades e incluso analizar el desempeño de quienes enseñan.

Y eso nos llevó a pensar: ¿Qué decisiones educativas queremos que tome una inteligencia artificial y cuáles requieren todavía interpretación, contexto y criterio humano?

Que la IA participe no es necesariamente el problema, ya que puede ser enormemente útil para dar feedback, identificar patrones, organizar información o aportar señales. La tensión aparece cuando convertimos una señal tecnológica en un veredicto sobre algo mucho más complejo: si un alumno aprendió, si hizo trampa, qué nota merece o incluso qué tan bien enseñó un docente. Los detectores de IA son un buen ejemplo de esa diferencia.

Los detectores de IA intentan responder una pregunta que cada vez es más difícil

Los detectores de inteligencia artificial no funcionan como un detector de plagio que encuentra una coincidencia entre un texto y una fuente existente. Analizan determinadas características del contenido y estiman la probabilidad de que haya sido generado por IA. Esa diferencia importa porque estamos hablando de una inferencia, no de una prueba directa.

La discusión sobre sus limitaciones ya lleva tiempo, pero durante 2026 aparecieron nuevas investigaciones y recomendaciones institucionales que vuelven a ponerla sobre la mesa. Un artículo publicado este año en Journal of Higher Education Policy and Management, por ejemplo, cuestiona su uso para tomar decisiones educativas por los problemas de confiabilidad, falsos positivos y justicia procedimental. La University of Kentucky también recomienda no utilizar detectores de IA con fines de evaluación y advierte que su eficacia cambia a medida que evolucionan los propios modelos generativos.

Hay además un problema conceptual: un texto ya no necesariamente es humano o artificial, puede ser ambas cosas.

Un alumno puede escribir un borrador, pedir feedback a una IA, aceptar dos sugerencias, rechazar otras tres, reescribir una parte, pedir ayuda con una fuente y después modificar nuevamente el resultado. Intentar reducir todo ese proceso a un porcentaje que diga “82% IA” no nos cuenta demasiado sobre lo que realmente ocurrió.

Un buen trabajo ya no necesariamente demuestra por sí solo todo lo que creemos

Durante muchísimo tiempo usamos el producto final como una de las principales evidencias de aprendizaje. Si un estudiante podía escribir un buen ensayo, resolver correctamente un problema o producir una presentación sólida, asumíamos razonablemente que detrás de ese resultado había determinadas capacidades.

La inteligencia artificial vuelve esa inferencia bastante más compleja. Un alumno puede entregar un excelente texto sin poder explicar su argumento. Otro puede utilizar IA durante todo el proceso y, sin embargo, haber investigado, comparado, cuestionado, corregido y aprendido muchísimo mientras trabajaba.

Por eso el problema no se resuelve simplemente prohibiendo la herramienta ni intentando determinar si estuvo presente.Lo que necesitamos recuperar es visibilidad sobre el proceso.

Si queremos saber qué aprendió un alumno, empieza a ser mucho más relevante entender cómo llegó a ese resultado: qué sabía al comienzo, qué decisiones tomó, dónde se equivocó, qué ayuda necesitó, qué cambió después de recibir feedback y qué puede explicar o defender cuando el trabajo ya está terminado.

Esto no significa documentar cada tecla que presiona un estudiante ni convertir la escuela en un sistema de vigilancia. De hecho, una investigación reciente sobre detectores advierte que exigir registros exhaustivos del proceso también puede generar problemas y modificar la manera en la que los estudiantes trabajan por miedo a ser acusados. La diferencia entre hacer visible el aprendizaje y vigilar al alumno importa muchísimo.

Si la IA está permitida, saber que se usó es apenas el comienzo

Imaginemos una actividad en la que la escuela permite utilizar inteligencia artificial.

Un alumno entrega un trabajo y sabemos con certeza que usó IA. ¿Y ahora qué? Todavía no sabemos si la utilizó para reemplazar todo el trabajo o para mejorar algo que había pensado previamente. No sabemos si aceptó automáticamente cada respuesta o si cuestionó algunas. Tampoco sabemos si podría explicar la conclusión a la que llegó, defender sus decisiones o resolver mañana un problema similar sin el mismo nivel de ayuda.

Por eso creemos que una evaluación adaptada a la era de la IA necesita combinar distintas evidencias.

Un borrador inicial puede mostrar desde dónde partió el alumno; una entrega intermedia puede hacer visible cómo evolucionó una idea; una breve reflexión puede explicar qué ayuda pidió y qué decisiones tomó; una conversación con el docente puede revelar si entiende aquello que presentó.

En algunos casos servirá un portfolio, en otros una defensa oral, una actividad presencial o simplemente una pregunta adicional después de la entrega.

No se trata de sumar burocracia a cada tarea, sino de elegir, según lo que queremos enseñar, qué evidencia necesitamos para saber si ese aprendizaje efectivamente ocurrió.

Esta conversación ya está apareciendo en universidades. La University of Michigan, por ejemplo, propone incorporar momentos del proceso, como propuestas, bibliografías comentadas, borradores y reflexiones breves, para que el pensamiento del estudiante no aparezca únicamente representado por el producto final.

Para nosotros, ahí está uno de los cambios más importantes que trae la IA a la evaluación: el resultado sigue importando, pero cada vez necesita más contexto.

El problema cambia cuando la IA también empieza a evaluar

Hasta ahora, buena parte de esta discusión estuvo concentrada en lo que hace el alumno con inteligencia artificial, pero la IA empieza a ocupar también otro lugar: el de quien observa, corrige y evalúa.

Una investigación publicada en septiembre de 2026 en Frontiers in Education comparó ChatGPT, Gemini, LeChat y Kimi corrigiendo exámenes escritos con las mismas pautas utilizadas por evaluadores humanos. Incluso el modelo que mostró mayor acuerdo, ChatGPT, coincidió exactamente con la calificación humana en el 50% de los casos y presentó variaciones cuando las evaluaciones se repitieron durante cinco días. Los investigadores concluyen que, por ahora, estos modelos parecen más adecuados como asistentes de evaluación supervisados que como evaluadores autónomos.

Al mismo tiempo, instituciones educativas empiezan a experimentar con inteligencia artificial para corregir trabajos, generar feedback e incluso analizar prácticas docentes. Esto no significa que la IA no tenga lugar en la evaluación, porque sí puede ayudar a detectar patrones, ofrecer una primera devolución, organizar evidencia o señalar aspectos que merecen atención, pero hay una diferencia importante entre ayudar a mirar y decidir qué significa lo que estamos mirando.

Una nota, una acusación de uso indebido de IA o una conclusión sobre cuánto aprendió un estudiante no son simplemente datos, son decisiones educativas que necesitan interpretar evidencia en un contexto: qué se esperaba aprender, cómo trabajó ese alumno, qué apoyo recibió, qué cambió durante el proceso y qué puede hacer después de él.

Por eso quizás una de las preguntas más importantes de esta etapa no sea solamente cuánto trabajo queremos delegarle a la inteligencia artificial, sino cuánto juicio estamos dispuestos a delegarle.

Procedencia no es lo mismo que aprendizaje

Otra parte de esta discusión tiene que ver con la procedencia del contenido.

Durante los últimos años intentamos tomar un texto terminado y determinar después si había sido generado por inteligencia artificial. Algunas empresas están empezando a abordar ese problema desde otro lugar: incorporar señales de procedencia desde el momento mismo en que el contenido se genera.

Anthropic, por ejemplo, implementó en modelos compatibles de Claude marcas de agua legibles por máquina en el texto generado y Credenciales de Contenido C2PA en determinados archivos. La marca puede viajar con un texto cuando se copia y pega, mientras que los archivos compatibles pueden incorporar metadatos firmados sobre su procedencia.

La propia compañía aclara algo que para educación es fundamental: detectar una de esas marcas puede indicar que el contenido fue procesado por Claude, pero no demuestra quién tuvo la idea original, cuánto modificó una persona después ni qué parte del trabajo intelectual hizo cada uno.

Ahora bien, la ausencia de una marca tampoco permite concluir automáticamente que no hubo IA, es una distinción muy útil.

Podemos empezar a resolver mejor el problema de saber de dónde salió un contenido. El desafío educativo es más grande: entender qué pasó durante el proceso de construirlo.

En Auroria creemos que el docente NO debería tener que jugar a ser detective

Esta distinción entre aportar evidencia y emitir un veredicto también forma parte de cómo diseñamos Auroria.

No queremos construir un sistema que decida automáticamente si un alumno hizo trampa o si aprendió. Queremos darle al docente más contexto y mejores evidencias para que pueda interpretar el proceso y tomar sus propias decisiones pedagógicas.

Por eso nuestra Aula Digital está incorporando trabajos escritos en los que el docente puede definir una consigna y sus criterios de evaluación, y el estudiante puede desarrollar su respuesta, entregarla, recibir feedback y volver a trabajar sobre ella. Las distintas versiones y devoluciones quedan reunidas como parte del recorrido.

La intención no es certificar autoría. Un historial de versiones no puede demostrar que un alumno no utilizó ChatGPT u otra herramienta por fuera de Auroria, y tampoco creemos que deba tratarse como una prueba de ese tipo. Lo que sí puede hacer es aportar evidencia pedagógica.

El docente puede observar desde dónde partió el estudiante, qué modificó después de recibir feedback, dónde persisten dificultades y cómo evolucionó su trabajo. Si aparece un cambio que necesita comprender mejor, tiene además información concreta desde la cual conversar con el alumno, pedirle que explique una decisión o profundizar sobre determinado concepto.

Esto también encaja con la manera en la que Auroria acompaña al estudiante. La ayuda socrática busca orientar mediante preguntas y pistas para que sea el alumno quien construya su respuesta. En ese contexto, marcar “texto producido por IA” diría muy poco sobre el trabajo cognitivo que ocurrió durante el proceso.

No buscamos que Auroria le diga al docente “este alumno hizo trampa”. Buscamos darle mejores evidencias para que pueda responder una pregunta pedagógicamente mucho más importante: ¿qué hizo, qué entendió y cómo llegó hasta acá?

Evaluar con IA no significa delegar el juicio

Quizás durante los primeros años de inteligencia artificial generativa tenía sentido concentrar buena parte de la energía en descubrir quién la estaba usando. Era una tecnología nueva, las reglas todavía no estaban claras y muchas instituciones estaban intentando entender qué hacer.

Pero estamos entrando en otra etapa. La IA ya puede formar parte legítima de una actividad, y por eso la evaluación no puede seguir dependiendo únicamente de una división entre “trabajo humano” y “trabajo hecho con IA”.

Para un docente, empieza a ser mucho más útil poder responder otras preguntas:

  • ¿el alumno entiende lo que entregó?
  • ¿puede explicar cómo llegó hasta ahí?
  • ¿qué decisiones tomó?
  • ¿qué ayuda necesitó?
  • ¿qué sugerencias aceptó y cuáles rechazó?
  • ¿puede aplicar lo aprendido en otro contexto?
  • ¿qué parte todavía no puede hacer sin asistencia?

No hace falta convertir cada evaluación en una investigación forense, tampoco hace falta renunciar a la inteligencia artificial allí donde puede ayudarnos. Lo que necesitamos es distinguir mejor qué puede aportar una máquina y qué decisión estamos tomando a partir de esa información.

Un detector puede aportar una señal, una marca de procedencia puede indicar que determinada herramienta intervino, un modelo puede encontrar patrones, comparar respuestas o sugerir feedback, un historial de versiones puede mostrarnos cómo evolucionó un trabajo.

Ninguna de esas cosas, por sí sola, nos dice necesariamente si un estudiante aprendió. La IA puede ayudarnos a ver más, teniendo en cuenta no confundir esa capacidad con la de comprender todo lo que estamos viendo.

En educación, quizás esa sea una frontera especialmente importante: utilizar la inteligencia artificial para ampliar la evidencia disponible sin entregarle automáticamente el juicio que hacemos sobre ella.


Sobre Auroria

Auroria es una plataforma argentina de inteligencia artificial pedagógica diseñada para acompañar a estudiantes, docentes, equipos directivos y familias.

La construimos desde la lógica de la escuela. Por eso no pensamos solamente en qué puede hacer la inteligencia artificial frente al alumno, sino también en qué necesita saber el docente para acompañar su aprendizaje.

En Aula Digital, los trabajos escritos pueden desarrollarse como un proceso de entrega, feedback y revisión. Las distintas versiones y devoluciones aportan contexto sobre cómo evoluciona el trabajo del estudiante y ayudan al docente a decidir qué preguntar, explicar o reforzar.

Ese registro no pretende certificar autoría ni determinar si hubo ayuda externa. Busca algo diferente: que el aprendizaje no quede representado únicamente por el producto final y que el docente tenga más evidencia para comprender el proceso que ocurrió detrás.


Preguntas frecuentes sobre IA y evaluación educativa

¿Los detectores de IA pueden saber con certeza si un alumno usó ChatGPT u otra inteligencia artificial?

No. Los detectores de IA suelen analizar características estadísticas o lingüísticas del texto y estimar la probabilidad de que haya sido generado por inteligencia artificial. Sus resultados pueden incluir falsos positivos y falsos negativos, por lo que distintas investigaciones e instituciones educativas desaconsejan utilizarlos como prueba concluyente de autoría o conducta académica.

¿Cuál es la diferencia entre un detector de IA y una marca de procedencia?

Un detector analiza un contenido terminado e intenta inferir si fue generado con IA. Una marca de procedencia se incorpora al contenido desde la propia herramienta que participó en su generación o procesamiento. Por ejemplo, modelos compatibles de Claude incorporan marcas de agua en texto y credenciales C2PA en determinados archivos.

¿Una marca de agua demuestra que un alumno no hizo el trabajo?

No. Una marca puede aportar información sobre la intervención de una herramienta, pero no demuestra cuánto del razonamiento, las ideas o la edición corresponden al estudiante. Anthropic, por ejemplo, advierte expresamente que una marca de Claude no confirma por sí sola la procedencia completa de un contenido. Por eso, para evaluar aprendizaje, la procedencia del texto es solamente una parte del problema. También necesitamos entender qué decisiones tomó el estudiante, cómo evolucionó su trabajo, qué ayuda necesitó y qué puede explicar o defender por sí mismo. En Auroria priorizamos hacer visible ese proceso antes que intentar convertir una señal tecnológica en una conclusión sobre la autoría o el aprendizaje.

¿Cómo puede un docente saber si un alumno aprendió cuando utilizó IA?

No existe una única evidencia suficiente para todos los casos. Según el objetivo de aprendizaje, pueden utilizarse borradores, entregas parciales, reflexiones sobre el proceso, conversaciones con el docente, defensas orales, portfolios o actividades en las que el estudiante deba explicar y aplicar aquello que presentó. Por eso una IA diseñada para educación no debería limitarse a producir respuestas: también debería ayudar a que el proceso de aprendizaje siga siendo visible para el docente.

¿Puede una inteligencia artificial corregir o calificar el trabajo de un alumno?

La IA puede ser útil para comparar respuestas con determinados criterios, identificar patrones, generar una primera devolución o asistir al docente durante una corrección. Pero eso no significa que deba utilizarse automáticamente como evaluador autónomo.

Una investigación publicada en septiembre de 2026 en Frontiers in Education comparó ChatGPT, Gemini, LeChat y Kimi evaluando exámenes escritos y encontró diferencias respecto de las calificaciones humanas y variaciones al repetir algunas evaluaciones. Los autores plantean que, por ahora, estos modelos resultan más adecuados como asistentes supervisados que como responsables autónomos de decisiones educativas de alto impacto.

La distinción es importante: una IA puede ayudar a analizar evidencia sin que necesariamente tenga que tomar la decisión final sobre qué significa esa evidencia.

¿Conviene pedir siempre historial de versiones para comprobar si un alumno hizo el trabajo?

No necesariamente. El historial puede aportar información sobre el proceso, pero no debería tratarse como prueba infalible de autoría. Investigaciones recientes señalan además que herramientas de IA pueden generar y editar documentos progresivamente, y que una supervisión excesiva del proceso puede afectar la confianza y la experiencia educativa.

¿Usar IA en un trabajo significa que hubo trampa?

No necesariamente. Depende de la política de la institución, de las reglas establecidas para esa actividad y del uso concreto que haya hecho el estudiante. La IA puede estar permitida para investigar, recibir feedback, practicar o revisar un trabajo, por ejemplo. Por eso las consignas deberían dejar claro qué usos están permitidos, qué debe seguir haciendo el alumno y qué evidencia de aprendizaje espera observar el docente.

¿Cómo ayuda Auroria al docente a entender el proceso detrás de un trabajo?

En Aula Digital, el docente puede proponer un trabajo escrito, establecer sus criterios y acompañar distintas instancias de entrega, feedback y revisión. Las versiones del trabajo y las devoluciones quedan reunidas para aportar contexto sobre cómo evolucionó la producción del estudiante.
Esto permite observar qué cambió, qué dificultades persisten y cómo respondió el alumno al feedback, además de ofrecer puntos concretos desde los cuales conversar con él o pedirle que explique determinadas decisiones.
Ese registro aporta evidencia del proceso, pero no certifica autoría ni permite descartar el uso de herramientas externas. Su objetivo es ayudar al docente a interpretar mejor el aprendizaje, no reemplazar su criterio con un veredicto tecnológico.

¿Qué debería cambiar en la evaluación escolar con la llegada de la IA?

Además del producto final, las escuelas pueden incorporar evidencia del proceso cuando sea relevante para el objetivo pedagógico: razonamiento, decisiones, revisiones, explicaciones y capacidad de aplicar o defender lo aprendido. La llegada de la IA no debería empujarnos a vigilar más, sino a diseñar mejores maneras de hacer visible el aprendizaje.


Fuentes

Report of MIT’s Ad Hoc Committee on AI Use in Teaching, Learning, and Research Training. MIT, agosto de 2026.

Pearce, B. y Webber, C. Heads we win, tails you lose: AI detectors in education. Journal of Higher Education Policy and Management, 2026.

University of Kentucky, Center for the Enhancement of Learning and Teaching. AI Detectors: Evidence and Recommendations for Use in Education.

University of Michigan, Learning and Teaching Consulting. If ChatGPT Writes it, Did the Student Learn It? 4 Practical Ways to Keep Essay Assessment Authentic, 2026.

Anthropic. Cómo Claude marca el contenido generado por IA, documentación oficial actualizada en septiembre de 2026.

¿Listo para integrar IA con criterio?
3 caminos · 0 permanencia