Educación
Cómo evaluar cuando el alumnado usa IA
Escala de uso permitido, evidencias de proceso, rúbrica por niveles y qué hacer ante una sospecha: evaluar sin depender de detectores que no funcionan.
- Tema
- Educación
- Publicado
- Actualizado
- Lectura
- 15 min
La pregunta que llega a los claustros en junio suele estar mal planteada. No es «cómo detecto si lo ha hecho con IA», porque eso no tiene respuesta fiable, sino qué recojo como evidencia de aprendizaje ahora que el producto final ya no lo demuestra. Y ahí la salida no es tecnológica: es de diseño de la evaluación y de acuerdos de centro.
La buena noticia es que la herramienta ya está en la norma. El artículo 15 del Real Decreto 217/2022, de ordenación y enseñanzas mínimas de la ESO, establece que «la evaluación del proceso de aprendizaje del alumnado de Educación Secundaria Obligatoria será continua, formativa e integradora», y el artículo 20 del Real Decreto 243/2022, del Bachillerato, repite la fórmula: «la evaluación del aprendizaje del alumnado será continua y diferenciada según las distintas materias». Una evaluación continua y formativa mira el proceso, y el proceso es justo lo que la IA no puede entregar por nadie.
Los detectores de IA no son una prueba de plagio
Antes de seguir hay que cerrar esa puerta, porque mientras siga entreabierta el resto del trabajo no se hace. Un detector de texto generado por IA no compara el trabajo con nada externo: analiza patrones estadísticos —previsibilidad del vocabulario, longitud y variedad de las frases— y calcula una probabilidad de que ese patrón lo haya producido un modelo de lenguaje. Ese diseño falla en los dos sentidos.
Falsos positivos, con texto escrito por personas. Marca como generado por IA lo que no lo es cuando el texto resulta, por otros motivos, previsible o muy regular: alumnado que escribe en una segunda lengua, con construcciones más simples y repetidas; alumnado con un estilo de redacción muy ordenado o esquemático; o cualquiera que redacte sobre un tema tan acotado que el vocabulario disponible se repite entre trabajos distintos. Ninguno ha hecho nada más que escribir como escribe siempre, y el detector no tiene forma de saberlo. El propio OpenAI, fabricante de la herramienta más usada por el alumnado, reconoce en su documentación para docentes que su investigación no encontró detectores lo bastante fiables para juicios con consecuencias duraderas sobre un alumno.
Falsos negativos, con texto generado por IA. El sentido contrario falla igual de fácil, y de esto se habla mucho menos. Un texto producido por un asistente y después reescrito —cambiando algunas frases, alterando el orden de los párrafos, pidiendo a otra herramienta que lo «humanice»— rompe justo el patrón estadístico que el detector busca. No hace falta mucha edición para conseguirlo, lo que deja el sistema especialmente débil frente a quien tiene algo de práctica.
Conviene además no confundir dos herramientas distintas, porque una búsqueda por «IA y plagio» las junta. Un detector de plagio tradicional compara el trabajo con una base de textos, páginas y publicaciones ya existentes, y cuando encuentra una coincidencia puede mostrar los dos textos uno junto al otro. Un detector de IA no compara con nada: solo estima. La consecuencia práctica es que un trabajo puede pasar limpio por un detector de plagio y haberlo escrito entero una IA —un texto generado no es copia de nada en concreto—, y al revés, salir marcado con probabilidad alta en un detector de IA sin que haya ningún indicio de plagio en el sentido clásico. Son dos preguntas distintas, y confundirlas lleva a decisiones mal fundamentadas en las dos direcciones.
Si el centro ya se apoya en un detector, nada de esto obliga a desinstalarlo de golpe: obliga a cambiarle el papel. De prueba a indicio interno; de argumento que se enseña a una familia a motivo para mirar un trabajo con más atención. Enseñar una puntuación a una familia como si fuera un veredicto tiene dos problemas: no es una prueba, y además traslada la responsabilidad de la decisión a una herramienta que nadie en la sala puede explicar con precisión. Este mismo aviso, con más ejemplos de aula, está en la guía práctica de IA en el aula.
Asumido eso, lo que queda es un trabajo de cinco pasos que un departamento puede sacar adelante en una tarde.
Paso 1. Declarar el nivel de uso de IA en cada tarea
Es el paso que más cambia las cosas y el que casi nadie da. Mientras el enunciado no diga qué se admite, cualquier decisión posterior es improvisada: no hay regla que aplicar, no hay nada que reclamar y cada docente sostiene la suya.
La forma que mejor funciona es una escala corta, común para todo el centro, que se cita por su número en cada tarea:
- Nivel 0 — Sin IA. La tarea se realiza sin asistentes. Se sostiene porque se hace en clase o porque se exige el proceso.
- Nivel 1 — IA para entender y planificar. Se admite para aclarar conceptos, explorar enfoques o resolver dudas, pero no para redactar lo que se entrega.
- Nivel 2 — IA para producir, con declaración. Se admite para redactar o generar partes del trabajo, indicando qué se ha usado y qué se ha corregido.
- Nivel 3 — IA sin límite. Se usa libremente y lo que se evalúa es el criterio: las instrucciones dadas, la verificación de los datos y las decisiones tomadas.
En el enunciado se concreta así:
«Nivel de uso de IA en esta tarea: 2. Puedes usar un asistente para los borradores. Al final del trabajo indica qué herramienta has usado, para qué parte y qué has cambiado de su respuesta. Los apartados de análisis se escriben en clase, sin asistente.»
Tres ventajas prácticas de hacerlo con una escala numerada y no con un párrafo distinto en cada tarea: el alumnado la aprende una vez, el profesorado no tiene que redactarla cada vez, y cuando hay una reclamación existe un criterio publicado con antelación, que es lo único que sostiene una decisión de evaluación.
Diseñar esta escala de niveles con criterios claros es exactamente lo que trabajamos en la formación en IA para docentes: no en abstracto, sino sobre las tareas reales del departamento que la va a aplicar. Si ya tenéis alguna tarea que se ha quedado sin criterio claro y queréis revisarla antes de escribir la escala definitiva, contadme el caso y lo miramos juntos.
Paso 2. Pedir evidencias del proceso, no solo el producto
Si la evaluación es continua y formativa, la evidencia no puede ser un único archivo entregado el domingo por la noche. Lo que hay que decidir por tipo de tarea es qué se recoge y cuándo:
| Tarea | Evidencia que la sostiene | Cuándo se recoge |
|---|---|---|
| Trabajo escrito largo | Borradores fechados y bibliografía comentada | En dos o tres hitos intermedios |
| Comentario de texto | Redacción del núcleo con el texto delante | En clase |
| Problemas y ejercicios | Explicación del procedimiento en voz alta | Al azar, sobre entregas ya hechas |
| Proyecto en grupo | Reparto documentado y diario de sesiones | Semanalmente |
| Exposición oral | Preguntas sobre decisiones, no sobre datos | En la propia exposición |
La columna de la derecha es la importante. Recoger evidencias «al final» no cambia nada: la clave es que existan hitos donde el trabajo se vea a medias, porque un trabajo a medias es difícil de encargar y fácil de comentar.
Y hay una variante que ahorra mucho tiempo de corrección: sustituir parte de la entrega escrita por tres minutos de defensa oral sobre decisiones concretas —por qué esta estructura, por qué esta fuente y no otra, qué descartaste—. Distingue con bastante claridad a quien ha hecho el trabajo, y se corrige mientras ocurre.
Paso 3. Qué criterios puntuar cuando la IA está permitida
Cuando la tarea es de nivel 2 o 3, la rúbrica tiene que evaluar algo distinto del texto entregado. Estos cinco criterios funcionan en secundaria y en ciclos, y se pueden añadir a una rúbrica que ya tengáis sin rehacerla:
- Calidad de las instrucciones. Si el uso de la herramienta está permitido, se valora si supo darle contexto, objetivo y límites, o si se conformó con «hazme un trabajo sobre esto».
- Verificación de la información. Si contrastó datos, fechas y citas, y si detectó lo que la herramienta se inventó. Es el criterio que más aprendizaje genera.
- Decisiones propias. Qué corrigió del resultado y por qué. Aquí se ve quién ha leído lo que entrega.
- Dominio al explicarlo. Si sostiene el contenido sin apoyo, en tres minutos de conversación.
- Honestidad en la declaración. Si lo declarado se corresponde con el trabajo. Se valora positivamente declarar, no se penaliza por sí mismo.
Un aviso sobre el quinto criterio: solo funciona si declarar no sale caro. En el momento en que el alumnado percibe que reconocer el uso de la herramienta baja la nota, deja de declararlo y volvemos al punto de partida.
Paso 4. La rúbrica: cruzar los criterios con el nivel declarado
Esos cinco criterios dicen qué se puntúa. Falta cruzarlos con el nivel declarado en el enunciado, porque no se mira lo mismo en un trabajo de nivel 0 que en uno de nivel 3. Eso es lo que hace la tabla siguiente: para cada nivel, qué evidencia buscar, qué preguntar y qué se está evaluando en realidad. La idea es que un departamento la copie en una tarde y la adapte a su asignatura, en vez de diseñar la suya desde cero cada curso.
Un aviso antes, porque conviene decirlo una sola vez y sin matices: esta rúbrica es una propuesta editorial de Aldomar, no un estándar oficial de ningún organismo educativo ni una escala que exija el currículo de ninguna etapa. Cada centro decide si la adopta tal cual, si recorta los niveles que no le sirven o si la sustituye por una propia. Lo único que no es opcional, si se quiere sostener una decisión de evaluación, es tener alguna publicada con antelación.
La lógica de fondo —niveles que van de «sin IA» a «uso sin límite», declarados antes de entregar la tarea— tampoco es una idea aislada: sigue el mismo enfoque que otros marcos publicados, como la AI Assessment Scale (AIAS), un esquema de cinco niveles publicado para declarar qué papel puede tener la IA en una tarea evaluable.
| Nivel | Qué se observa | Qué preguntar al alumno | Cómo puntúa |
|---|---|---|---|
| 0 — Sin IA | El trabajo se hace en clase o en condiciones controladas, sin asistente | No aplica una pregunta distinta de la corrección habitual | Se evalúa con los criterios normales de la materia, sin ningún ajuste |
| 1 — IA para entender y planificar | Esquema previo, notas propias, conversación con la IA si se guardó | «¿Qué le preguntaste? ¿Qué hiciste con la respuesta?» | Se evalúa el texto entregado como si no hubiera IA de por medio |
| 2 — IA para producir, con declaración | Declaración de uso, borrador de la IA si está disponible, cambios señalados | «¿Qué cambiaste de lo que te dio y por qué?» | Se puntúa la revisión y el criterio propio, no el borrador en sí |
| 3 — IA sin límite | Instrucciones dadas, verificación de datos, defensa oral breve | «¿Cómo comprobaste que era correcto? ¿Qué descartaste?» | Se puntúa el proceso completo: instrucciones, verificación y decisiones |
La columna que más distingue no es la del nivel: es la de qué se le pregunta al alumno sobre su propio trabajo. Quien ha dirigido de verdad el proceso responde con detalle específico; quien se ha limitado a copiar la primera respuesta no suele tener mucho que contar.
Dos matices al usarla. El nivel 0 sirve sobre todo como ancla: si se sospecha de un trabajo de nivel 2 o 3, saber cómo escribe y razona ese mismo alumno en condiciones de nivel 0 —un examen en clase, un comentario hecho sin asistente— da un punto de comparación que no depende de ningún detector. Y el nivel 2 es donde la rúbrica hace más trabajo, porque es el más habitual y el más fácil de evaluar mal: ahí la pregunta útil no es «¿usaste IA?», que ya está declarado, sino qué cambió de lo que le devolvió y por qué.
La conversación entregada como evidencia también son datos
Un detalle que se pasa por alto al pedir la conversación con el asistente como anexo: ese archivo casi nunca contiene solo la tarea. Alrededor de las preguntas del trabajo aparecen dudas personales, referencias a compañeros, circunstancias de casa —cosas que el alumno escribió sin pensar que iba a entregarlas—, y en cuanto se recogen pasan a ser datos personales de un menor y, a veces, de terceros que no han dicho nada.
Si la vais a pedir, conviene decidir tres cosas antes y escribirlas en el enunciado: que basta con el fragmento relacionado con la tarea, no el historial entero; que se entrega por el mismo canal que el resto del trabajo —la plataforma del centro, no un correo personal ni un enlace compartido—; y cuánto tiempo se conserva antes de eliminarla, con el mismo criterio que cualquier otra evidencia de evaluación. La alternativa que evita el problema casi siempre es suficiente: pedir la declaración de tres líneas y la defensa oral, y guardar la conversación solo en las tareas donde el uso de la herramienta sea el objeto de la evaluación.
Cómo pesa en la nota, sin inventar una escala que no existe
La tabla no sustituye los criterios de evaluación de la materia: los complementa en la parte que la IA ha dejado tocada. Cómo se traduce exactamente en la calificación final depende de cómo tenga articulado cada centro su sistema de evaluación, que varía por etapa y por comunidad autónoma, así que no hay una fórmula única. En la práctica se encaja de una de estas tres formas, y ninguna es más correcta que otra en abstracto:
- Como parte de un criterio ya existente, si la materia ya pondera algo como «proceso de trabajo» o «uso de fuentes»: la rúbrica aporta las evidencias concretas que faltaban para aplicarlo a una tarea con IA.
- Como requisito de validez de la entrega, en tareas donde no declarar el nivel de uso o no poder sostener una defensa breve hace que el trabajo no se dé por válido, con independencia de lo bien redactado que esté.
- Como valoración competencial aparte, en centros que ya evalúan por competencias y quieren registrar el uso de herramientas digitales como una competencia propia, distinta de la del contenido de la materia.
Lo que no cambia entre las tres es el principio de fondo: la nota la pone una persona, con la evidencia delante, no un número que salga automáticamente de la tabla.
Cómo ponerla en marcha sin que se quede en un PDF
Tres ajustes son habituales cuando un departamento la adapta: reducirla a los niveles que realmente se usan en esa materia —hay asignaturas donde el nivel 3 casi nunca se admite—, sustituir las preguntas por otras específicas del tipo de tarea, y añadir una cabecera con el nombre de la asignatura para que quede claro que es la versión local y no la genérica.
Después, dos pasos pequeños evitan que acabe archivada: probarla primero en una sola tarea, no en todas a la vez, porque la primera vez siempre aparece alguna pregunta que no funciona con el grupo real; y revisarla en la siguiente reunión de departamento con lo que haya pasado —qué preguntas dieron información útil, cuáles se quedaron cortas, si algún nivel se usó tan poco que no merece la pena mantenerlo—. Declarar, probar, revisar: ese ciclo corto es lo que distingue una rúbrica que se usa de una que se archiva.
Si hay que justificar todo esto en el plan digital del centro, el Marco de Referencia de la Competencia Digital Docente —publicado en el BOE por acuerdo de la Conferencia Sectorial de Educación— dedica su Área 4 a «Evaluación y retroalimentación», que es el sitio natural donde encaja este trabajo.
Paso 5. Qué hacer ante una sospecha
Este es el momento en el que más se equivoca el profesorado con buena intención, porque la conversación se abre acusando y a partir de ahí solo hay dos salidas malas. El procedimiento que sí aguanta:
- Abrir preguntando por el proceso, no afirmando nada: cómo lo empezó, qué fuentes usó, qué le costó más.
- Pedir la evidencia que ya estaba anunciada en el enunciado: borradores, notas, versiones. Si no se anunció, este paso no existe, y eso es información sobre el diseño de la tarea, no sobre el alumno.
- Conversar tres minutos sobre decisiones concretas del trabajo entregado.
- Aplicar el criterio publicado, no uno improvisado esa tarde. Si el enunciado fijaba un nivel de uso, la decisión se apoya en él.
- Dejar constancia escrita de la conversación y de la decisión, y comunicarla por el cauce que tenga el centro. Es lo que permite sostenerla si llega una reclamación semanas después.
Una cosa que no debe hacerse en ningún punto de ese proceso: subir el trabajo a una herramienta externa para «comprobarlo». Un trabajo escolar contiene datos personales de un menor y, con frecuencia, de su entorno. Los criterios sobre qué no puede salir del centro los trato en la guía práctica de IA en el aula.
¿Puedo usar IA para corregir?
Depende de qué se entienda por corregir, y la distinción no es una sutileza.
Preparar retroalimentación es material de clase. Pedir un borrador de comentarios sobre un texto anonimizado, o generar variantes de una observación para veinte trabajos parecidos, es preparación docente: se revisa y se firma como cualquier otro material.
Poner la nota es una decisión. La Comisión Europea, en su página sobre el marco regulador de la IA, clasifica como de alto riesgo las soluciones de IA usadas en instituciones educativas «que puedan determinar el acceso a la educación y el curso de la vida profesional de alguien», y pone como ejemplo explícito la puntuación de exámenes. No es una prohibición general del uso de la IA en el centro: es una advertencia sobre dónde está la línea. Delegar la calificación en una herramienta cambia de categoría el uso, y con ella las obligaciones.
En la práctica, la regla que doy en los claustros es corta: la IA puede escribir un borrador de lo que vas a decirle al alumnado, nunca decidir lo que va a pasarle.
Lo que tiene que decidir el centro, no cada docente
Casi todo lo anterior falla si cada docente lo aplica a su manera, porque el alumnado compara y las familias también. Los cuatro acuerdos mínimos que conviene sacar de una sesión de claustro:
- La escala de niveles de uso, con los mismos números para todo el centro.
- Qué evidencias de proceso son exigibles en cada etapa y tipo de tarea.
- El procedimiento ante una sospecha, incluido quién acompaña al docente y qué se registra.
- Qué se comunica a las familias y en qué momento del curso, para que no se enteren cuando ya hay un conflicto.
Cuatro acuerdos, una sesión y un documento de una página. Un claustro con eso escrito puede sostener una conversación incómoda con una familia; uno donde cada docente aplica su criterio, no.
Esta es la parte que trabajo en la formación en IA para docentes: el rediseño se hace con vuestras tareas reales y la sesión termina con el borrador de acuerdos escrito por el propio claustro. El itinerario completo para el centro está en formación en IA para colegios e institutos, y la otra mitad del trabajo —llevar al aula lo acordado, con ejercicios de verificación— son los talleres de IA para institutos.
Si tenéis un par de tareas que se han quedado tocadas y queréis verlas antes de empezar el curso, escríbeme y buscamos media hora con el material delante.
Preguntas frecuentes
¿Puedo bajar la nota por usar IA si no lo había dicho por escrito?
Es terreno resbaladizo. Si el enunciado no decía nada, la reclamación de la familia tiene un argumento fácil: no se puede penalizar el incumplimiento de una regla que no estaba publicada. Lo defendible es evaluar lo que sí estaba en los criterios —dominio del contenido, justificación de las decisiones— y publicar la regla para las siguientes tareas.
¿Cómo pido que declaren el uso de IA sin generar papeleo?
Con tres líneas al final del trabajo: qué herramienta han usado, para qué parte y qué han cambiado de lo que les devolvió. No hace falta adjuntar conversaciones enteras salvo en tareas donde el uso de la herramienta sea el objeto de la evaluación. Si la declaración es corta y no se penaliza por sí misma, se cumple.
¿La rúbrica por niveles es un estándar oficial que tengo que aplicar?
No. Es una propuesta editorial construida sobre el criterio que se explica en este artículo, pensada para que un departamento no tenga que diseñar la suya desde cero. Ningún organismo educativo la exige ni la ha publicado como norma. Podéis copiarla tal cual, recortar los niveles que no os sirvan o cambiar las preguntas por otras que encajen mejor con vuestra materia.
¿Qué diferencia hay entre un detector de plagio y un detector de IA?
Un detector de plagio tradicional compara un texto con una base de trabajos, páginas web y publicaciones ya existentes, y señala coincidencias literales. Un detector de IA no compara con nada: calcula, por patrones estadísticos del texto, una probabilidad de que lo haya generado un modelo de lenguaje. Son dos preguntas distintas y una búsqueda por «IA y plagio» suele mezclarlas.
¿Puedo usar IA para corregir y poner las notas?
Para preparar borradores de retroalimentación sobre texto anonimizado, sí, revisándolos. Para poner la nota, no: la calificación es una decisión con consecuencias académicas y un responsable detrás, y los usos de IA que determinan el acceso a la educación o el itinerario de una persona están clasificados como de alto riesgo en el Reglamento europeo de IA.
¿Qué hago si el alumno niega haberla usado y no tengo pruebas?
No sostener una acusación que no puedes probar. Evaluar con lo que tienes: pedirle que explique decisiones concretas del trabajo y calificar según los criterios publicados. Si el resultado escrito no se corresponde con lo que sabe explicar, eso ya es información evaluable sin necesidad de afirmar quién escribió qué.