Tras tres meses de colonoscopia asistida por IA, 19 médicos expertos detectaron un 21 % menos de adenomas sin ella. Cuarenta años de pruebas, auditadas.
La prueba de la retirada
Diecinueve médicos veteranos, tres meses de asistencia y seis puntos de destreza desaparecidos
Entre septiembre de 2021 y marzo de 2022, cuatro centros de endoscopia polacos incorporaron la inteligencia artificial a la colonoscopia de rutina. Cuando esos mismos 19 facultativos volvieron a trabajar sin ella, su tasa de detección de adenomas había caído del 28,4 % al 22,4 %✓ Hecho establecido [1], un retroceso relativo del 21 % en la destreza diagnóstica que define la especialidad✓ Hecho establecido [2]. No se les había retirado nada salvo la práctica. Este informe examina cuándo se produce ese canje, cuándo no, y qué establecen ya cuarenta años de estudios controlados sobre calculadoras, bolígrafos y navegación por satélite acerca de esa diferencia.
La evidencia ofrece una respuesta precisa, y es más antigua que la polémica actual. Descargar una tarea cognitiva en una máquina degrada la capacidad subyacente cuando la máquina elimina el paso de recuperación o de generación que la persona habría ejecutado, y deja esa capacidad intacta, o incluso la mejora, cuando solo elimina la fricción que rodea a un paso que la persona sigue ejecutando◈ Evidencia sólida [12]. El estudio polaco sobre colonoscopia constituye el experimento natural más nítido publicado hasta la fecha sobre el primer supuesto. Diecinueve endoscopistas, con más de 2.000 procedimientos a sus espaldas cada uno, quedaron expuestos durante tres meses a la detección asistida por IA en cuatro centros participantes en un ensayo de prevención del cáncer; su tasa de detección sin asistencia cayó después seis puntos porcentuales✓ Hecho establecido [1].
La población que hoy realiza este experimento sobre sí misma abarca buena parte de una generación. La tercera encuesta anual a estudiantes británicos de grado, publicada en marzo de 2026 a partir de 1.054 respuestas a tiempo completo, halló que el 95 % recurre a la IA generativa de alguna forma y que el 94 % la emplea en trabajos evaluados✓ Hecho establecido [20]. La proporción que pega directamente texto generado por IA en un trabajo entregado alcanzó el 12 %, frente al 8 % en 2025 y el 3 % en 2024✓ Hecho establecido [20]. La provisión institucional se triplicó en esos mismos dos años: del 9 % de estudiantes que declaraban disponer de herramientas facilitadas por su universidad en 2024 se pasó al 38 % en 2026✓ Hecho establecido [20]. La adopción ya no es una conducta estudiantil que vigilar; es infraestructura que se compra.
Los datos de comportamiento a gran escala muestran qué cambió esa compra. Un panel de diez años con 3,2 millones de interacciones en la plataforma de matemáticas adaptativa ALEKS comparó los contenidos que se transcriben con facilidad a una consulta conversacional con los contenidos gráficos que no lo permiten. El tiempo de estudio dedicado a los contenidos vulnerables a la IA retrocedió un 2,8 % por trimestre entre los universitarios tras la aparición de ChatGPT, un 26,9 % acumulado a lo largo de once trimestres, con un 31,3 % en el alumnado de secundaria superior y ninguna variación detectable en quinto de primaria◈ Evidencia sólida [21]. En ítems de retención supervisados y asignados al azar, la probabilidad de una respuesta correcta cayó un 25 % acumulado◈ Evidencia sólida [21]. Ejecución más rápida, conocimiento menos duradero, medido sobre los mismos alumnos y el mismo temario.
Las series agregadas de competencias ya venían cayendo antes de todo esto. La Evaluación de Competencias de Adultos de la Organización para la Cooperación y el Desarrollo Económicos (OCDE), que examinó a unas 160.000 personas de 16 a 65 años en 31 países y se publicó en diciembre de 2024, constató que la comprensión lectora solo mejoró en la década precedente en dos países, Finlandia y Dinamarca, y que se mantuvo estable o retrocedió en todos los demás✓ Hecho establecido [18]. La competencia matemática salió mejor parada, con avances en ocho países✓ Hecho establecido [18]. Los retrocesos fueron mayores entre las personas menos formadas, lo que amplió la brecha dentro de cada país✓ Hecho establecido [19]. Los datos escolares apuntan en la misma dirección: el rendimiento medio de la OCDE en matemáticas perdió unos 15 puntos entre 2018 y 2022, y la lectura alrededor de 10✓ Hecho establecido [34].
Nada de esto constituye una prueba sobre la inteligencia artificial, y tomarlo como tal sería el primer error al alcance de la mano. El descenso de las competencias adultas precede a ChatGPT en una década; la inversión del efecto Flynn medida en unos 394.000 adultos estadounidenses abarca de 2006 a 2018, antes de que existieran los grandes modelos de lenguaje, y no afectó a todos los dominios: el razonamiento verbal, el razonamiento matricial y las series de letras y números bajaron mientras la rotación tridimensional subía✓ Hecho establecido [22][33]. Lo que estas series establecen es una línea de partida, no una causa. Describen a una población cuyo rendimiento cognitivo medido ya se desplazaba cuando llegó un dispositivo de descarga de uso general.
El diseño es observacional, pero de una nitidez poco habitual: los mismos 19 operadores, los mismos cuatro centros, el mismo procedimiento, antes y después. La detección de adenomas en colonoscopias realizadas sin IA cayó del 28,4 % —226 procedimientos de 795— al 22,4 %, es decir, 145 de 648✓ Hecho establecido [1]. Los procedimientos asistidos del mismo periodo se situaron en el 25,3 %, 186 de 734✓ Hecho establecido [2]. Cada operador había realizado más de 2.000 colonoscopias antes de iniciarse el estudio, lo que descarta el factor de confusión evidente de la inexperiencia✓ Hecho establecido [1]. El resultado se publicó en The Lancet Gastroenterology and Hepatology el 12 de agosto de 2025✓ Hecho establecido [2].
Este informe avanza en el orden en que se produjo la evidencia. La segunda sección expone por qué las mentes delegan y por qué el juicio que gobierna esa delegación resulta sistemáticamente poco fiable. La tercera aborda la navegación, el único ámbito en el que el coste estructural se ha visualizado directamente. La cuarta regresa a los estudios controlados sobre calculadoras y toma de apuntes, que ya respondieron a la pregunta general. Las secciones quinta y sexta auditan la literatura sobre grandes modelos de lenguaje y el historial de pérdida de destreza profesional. La séptima compara lo que cinco Estados han hecho realmente. La octava enuncia qué puede sostener la evidencia y qué no.
Por qué delegan las mentes
La descarga es una estrategia racional apoyada en una autoevaluación frecuentemente errónea
La descarga cognitiva no es una patología moderna. Es el uso ordinario de la acción física para reducir la demanda cognitiva interna: inclinar la cabeza para leer una imagen girada, anotar una cita, programar una alarma✓ Hecho establecido [12]. La decisión de descargar se rige por un juicio metacognitivo sobre la propia capacidad, y ese juicio resulta falible de forma mensurable en ambas direcciones◈ Evidencia sólida [12]. La pregunta relevante no es si las personas descargan, sino qué le hace el acto de descargar a la aptitud que se está evaluando.
El marco que ordena esta literatura lo formularon Evan Risko y Sam Gilbert en Trends in Cognitive Sciences en 2016, y consta de tres piezas móviles. La propensión a descargar depende de la demanda cognitiva interna que la tarea impondría en otro caso y de una evaluación metacognitiva de la propia aptitud; el acto de descargar retroalimenta después esa evaluación; y la descarga produce efectos directos sobre la capacidad cognitiva◈ Evidencia sólida [12]. El problema reside en el término intermedio. Quien delega de forma sistemática una tarea deja de recibir la información sobre su propia competencia que le indicaría si la delegación sigue estando justificada.
El anclaje empírico más citado es también el más dañado. En 2011, Betsy Sparrow, Jenny Liu y Daniel Wegner presentaron cuatro estudios que indicaban que, cuando las personas prevén un acceso continuado a una información, la recuerdan peor y recuerdan mejor dónde encontrarla✓ Hecho establecido [11]. El hallazgo pasó al uso corriente como efecto Google, o amnesia digital. También pasó a la crisis de replicación: réplicas con alta potencia estadística no reprodujeron su componente más citado, el experimento de priming de Stroop, y las síntesis posteriores sugieren que el efecto global es real, pero menor y mucho más dependiente del contexto de lo que daba a entender el artículo original⚖ Controvertido [11].
Esa corrección pesa más de lo que suele admitirse. La forma fuerte del efecto Google, según la cual los buscadores habrían vaciado la memoria semántica, no está establecida, y este informe no la sostiene. La forma defendible es más estrecha y más antigua: la memoria es transactiva. Los seres humanos siempre han repartido lo que saben entre otras personas, e internet extendió un mecanismo preexistente a un socio no humano✓ Hecho establecido [11]. Un sistema transactivo resulta eficiente exactamente mientras el socio siga disponible y sea exacto. Su modo de fallo no es el olvido, sino la incapacidad de detectar que el socio se ha equivocado.
Dejarán de ejercitar la memoria porque confiarán en lo escrito, trayendo las cosas al recuerdo ya no desde dentro de sí mismos, sino por medio de marcas externas.
— Sócrates, en el Fedro de Platón, hacia el 370 a. C.La objeción de que este argumento tiene 2.400 años y ha errado siempre merece tomarse en serio, porque es medio cierta. La escritura sí externalizó la memoria, y Sócrates acertó en el mecanismo mientras se equivocaba en la consecuencia✓ Hecho establecido [32]. Las sociedades letradas no se volvieron menos capaces; se volvieron capaces de cosas distintas y mayores, porque la escritura no retiró tanto un paso del pensamiento como le añadió un sustrato permanente. El registro histórico, por tanto, no autoriza ni el pánico ni la complacencia. Autoriza una pregunta sobre qué paso concreto elimina cada herramienta.
Esa pregunta puede concretarse. Una calculadora elimina la ejecución de un algoritmo que el alumno ya ha aprendido a elegir. Un dispositivo de navegación por satélite elimina la construcción de la representación espacial, no solo su ejecución. Un corrector ortográfico elimina la recuperación de una forma gráfica una vez elegida la palabra. Un gran modelo de lenguaje al que se le pide un ensayo elimina la selección del argumento, la recuperación de las pruebas, la ordenación de las afirmaciones y la generación de las frases: todos los pasos salvo la instrucción y el juicio sobre el resultado. No son intervenciones equivalentes, y nada autoriza a esperar de ellas el mismo desenlace.
Es la capa metacognitiva la que vuelve difícil advertir la diferencia desde dentro. La encuesta de Microsoft Research y la Universidad Carnegie Mellon a 319 trabajadores del conocimiento, sobre 936 usos reales y presentada en la conferencia de 2025 sobre factores humanos en informática, halló que una mayor confianza en el sistema de IA se asocia a un escrutinio crítico menor de sus resultados, mientras que una mayor confianza en la propia destreza se asocia a un escrutinio mayor✓ Hecho establecido [6]. Bajo asistencia, la competencia y la percepción de la competencia se separan. Y la persona mejor situada para advertir una destreza degradada es precisamente aquella cuya destreza degradada realiza la advertencia.
Lo que dice la navegación
El único ámbito donde el coste estructural se ha visualizado, medido en el tiempo y demostrado reversible
La navegación espacial es la única función cognitiva para la que el argumento de la descarga cuenta con evidencia neuroanatómica directa en ambos lados del balance. Construir un mapa cognitivo aumenta el hipocampo posterior✓ Hecho establecido [9]; dejar de construirlo se asocia a un deterioro más rápido, a lo largo de tres años, de la memoria espacial dependiente del hipocampo◈ Evidencia sólida [8]. El taxi londinense aportó por accidente la primera mitad de ese hallazgo, y la navegación por satélite aportó la segunda.
The Knowledge, el examen de habilitación de los taxistas londinenses, exige memorizar unas 25.000 calles y saber trazar una ruta entre dos puntos cualesquiera sin ayuda externa. En 2000, Eleanor Maguire y sus colegas comunicaron en Proceedings of the National Academy of Sciences que el hipocampo posterior de los taxistas londinenses habilitados era significativamente mayor que el de los controles, y que ese volumen correlacionaba con el tiempo pasado al volante, positivamente en la región posterior y negativamente en la anterior✓ Hecho establecido [9]. La estructura seguía al uso, en adultos, en una región cerebral que durante mucho tiempo se supuso fija tras el desarrollo.
Son los trabajos posteriores los que sostienen el argumento. El aumento no es permanente ni gratuito. Las revisiones de la literatura sobre taxistas recogen que la ventaja hipocampal posterior retrocede por desuso tras la jubilación, y que los conductores mayores todavía en activo conservaban ventaja sobre quienes habían dejado de conducir◈ Evidencia sólida [10]. La contrapartida está igual de documentada: esos mismos conductores rendían peor que los controles en algunas tareas de adquisición de información visoespacial nueva◈ Evidencia sólida [10]. Una pericia de este tipo se arrienda, no se compra, y el alquiler se paga en recuperación continuada.
La pregunta moderna evidente, qué ocurre cuando cesa la recuperación, la respondieron Louisa Dahmani y Véronique Bohbot en Scientific Reports en abril de 2020. Evaluaron la experiencia acumulada de navegación por satélite en 50 conductores habituales junto con varias facetas de la memoria espacial: uso de estrategias, cartografía cognitiva y codificación de hitos. Un uso acumulado mayor se asociaba a una memoria espacial peor durante la navegación autónoma, es decir, cuando el dispositivo no estaba disponible✓ Hecho establecido [8]. El resultado transversal, por sí solo, es ambiguo, y las autoras lo sabían.
Trece de los participantes iniciales fueron reevaluados tres años después de la primera sesión. Un uso más intenso del dispositivo en el intervalo se asoció a un deterioro más pronunciado de la memoria espacial dependiente del hipocampo◈ Evidencia sólida [8]. La explicación por causalidad inversa, según la cual quienes tienen mal sentido de la orientación adoptarían más el dispositivo, se puso a prueba y no se sostuvo: los usuarios intensivos no declaraban haberlo adoptado porque se orientaran mal◈ Evidencia sólida [8]. El sentido de la flecha constituye todo el hallazgo. Sin él, la correlación transversal no pesaría más que la observación de que quienes consultan diccionarios escriben con menos seguridad.
El efecto no se limita a una tarea de laboratorio. La estrategia de navegación basada en hitos, evaluada en más de 37.000 participantes, decae a lo largo de toda la vida humana, y el equilibrio entre estrategia por hitos y estrategia cartográfica es exactamente lo que elimina la guía giro a giro✓ Hecho establecido [10]. Un conductor que sigue instrucciones habladas ejecuta una secuencia; no mantiene una representación. Desde fuera del vehículo, la conducta parece idéntica. Dentro, una de las dos operaciones que moldearon el hipocampo de los taxistas ha dejado de realizarse.
Aquí caben dos cautelas. La muestra de navegación por satélite es reducida —50 participantes en el corte transversal, 13 en el longitudinal— y un seguimiento de tres años sobre trece personas es una señal, no un veredicto⚖ Controvertido [8]. Además, ningún estudio ha demostrado que una memoria espacial reducida produzca en esta población perjuicio funcional alguno en la vida ordinaria, porque la vida ordinaria incluye ya el dispositivo. El hallazgo es que se atrofia la capacidad interna, no que la persona se oriente peor. Son afirmaciones distintas, y la segunda no se ha demostrado.
Lo que la navegación aporta al argumento general es un mecanismo con sustrato medido. Una herramienta que sustituye a la construcción de una representación interna se asocia al deterioro de esa representación y del tejido que la mantiene; el deterioro sigue a la cantidad de sustitución; y se invierte en sentido contrario cuando la representación se reconstruye✓ Hecho establecido [9][10]. Es una afirmación bastante más fuerte que cuanto puede sostener hoy la literatura general sobre descarga, y está disponible en un solo ámbito. El resto de este informe trata de hasta dónde generaliza.
Lo que los estudios controlados ya habían zanjado
Las calculadoras, la guerra del bolígrafo contra el teclado y las dificultades deseables respondieron antes de que se formulara la pregunta
El debate sobre la IA se desarrolla como si no existiera evidencia previa sobre herramientas que ejecutan parte de una tarea cognitiva. Existe mucha, está excepcionalmente bien controlada y converge: el daño no está en la herramienta, sino en si esta elimina o no el paso en el que ocurre el aprendizaje◈ Evidencia sólida [13][17]. Un metaanálisis de 79 estudios sobre calculadoras publicado en 1986 halló mejoras en todos los cursos salvo uno, y esa excepción es el resultado más instructivo del conjunto✓ Hecho establecido [13].
Ray Hembree y Donald Dessart integraron 79 informes de investigación sobre calculadoras de bolsillo para el Journal for Research in Mathematics Education en 1986. En todos los cursos salvo el cuarto de primaria, el uso de la calculadora junto a la enseñanza convencional mejoraba las destrezas de lápiz y papel del alumno medio, tanto en ejercicios como en resolución de problemas✓ Hecho establecido [13]. La actitud y el autoconcepto matemático mejoraron en todos los cursos y niveles de aptitud✓ Hecho establecido [13]. Trabajos posteriores sobre calculadoras gráficas llegaron a conclusiones compatibles, con efectos más marcados allí donde el dispositivo se integraba en la enseñanza para la exploración y el trabajo conceptual en lugar de repartirse para la práctica repetitiva y la comprobación◈ Evidencia sólida [14].
El cuarto curso es la excepción que precisa la regla. Un uso sostenido de la calculadora en ese nivel parecía obstaculizar el desarrollo de las destrezas básicas en alumnos medios✓ Hecho establecido [13]. Cuarto es el curso en el que se consolidan los procedimientos aritméticos de varias cifras, donde la recuperación y la ejecución constituyen el objeto mismo del aprendizaje y no la carga que lo rodea. Si la herramienta se despliega antes de que el procedimiento sea automático, ocupa el hueco donde se habría formado el automatismo. Si se despliega después, libera capacidad para el paso siguiente. Mismo aparato, signo opuesto, y la variable es la posición evolutiva del aprendiz.
La literatura sobre toma de apuntes muestra el modo de fallo contrario, y advierte contra el propio argumento de este informe. El resultado de 2014, ampliamente citado, según el cual los apuntes manuscritos superarían a los tomados con ordenador en las preguntas conceptuales, porque el soporte más lento fuerza un procesamiento generativo, no sobrevivió a la replicación directa. Kayla Morehead, John Dunlosky y Katherine Rawson no hallaron diferencias consistentes entre escritura a mano, ordenador portátil, pizarra electrónica y, cosa notable, un grupo que no tomaba apuntes⚖ Controvertido [15]. Una amplia replicación directa publicada en Psychological Science llegó a la misma conclusión, con minimetaanálisis que arrojaban efectos pequeños y no significativos a favor del manuscrito⚖ Controvertido [16].
Dos resultados nulos y uno positivo intenso no constituyen una contradicción, sino una especificación. Lo que el hallazgo de las calculadoras y el de los apuntes comparten es que ninguna de las dos herramientas eliminaba el paso generativo en los casos en que no causó daño. Una calculadora entregada una vez automatizado el procedimiento aritmético deja en manos del alumno la elección del procedimiento. Un portátil empleado para tomar apuntes sigue exigiendo al alumno decidir qué merece registrarse. Donde la herramienta sí dañó, en la aritmética de cuarto curso, ocupaba exactamente la operación que el temario existía para instalar.
La literatura de las ciencias del aprendizaje nombra directamente la variable ausente. El marco de las dificultades deseables, de Robert y Elizabeth Bjork, sostiene que las condiciones que deprimen el rendimiento durante el aprendizaje —el espaciado, el entrelazado, la autogeneración, la práctica de recuperación— mejoran la retención y la transferencia a largo plazo◈ Evidencia sólida [17]. El acto de recuperar información constituye, por su efecto sobre la accesibilidad posterior, un suceso más potente que el de volver a estudiarla◈ Evidencia sólida [17]. Toda herramienta que sustituya a la recuperación elimina, por tanto, la operación que construye conocimiento duradero, haga lo que haga con el rendimiento del día.
La cifra más útil de toda la literatura sobre descarga es la excepción de un metaanálisis de hace cuarenta años. Las calculadoras ayudaron en todos los cursos salvo aquel en el que el procedimiento automatizado era precisamente lo que se estaba aprendiendo✓ Hecho establecido [13]. No es un dato sobre calculadoras, sino una regla de despliegue de herramientas: la asistencia resulta inocua sobre operaciones ya interiorizadas y corrosiva sobre las que no lo están. Toda política de IA escolar que hoy se redacta constituye, lo sepa o no, una apuesta sobre dónde se sitúa cada alumno respecto de esa línea.
El marco de las dificultades deseables trae también su propio límite, y la honestidad obliga a enunciarlo. Los efectos no son universales: se atenúan o se invierten cuando la memoria de trabajo ya está saturada por material de alta interactividad entre elementos⚖ Controvertido [17]. La dificultad solo resulta deseable allí donde el aprendiz tiene medios para afrontarla. Esa salvedad corta en ambos sentidos para el argumento presente. Debilita cualquier afirmación general de que la fricción sea buena, y refuerza la afirmación más estrecha de que el valor de una herramienta depende por completo de qué paso retira y a quién se lo retira.
Lo que muestran los modelos de lenguaje
Cuatro diseños independientes, tres años de datos y una sola dirección
La literatura sobre grandes modelos de lenguaje y cognición apenas tiene tres años y ya contiene cuatro estudios metodológicamente inconexos que apuntan en el mismo sentido: una electroencefalografía de laboratorio, una encuesta a 666 adultos, una encuesta a 319 trabajadores del conocimiento y un experimento controlado de aprendizaje sobre revisión de ensayos◈ Evidencia sólida [3][5][6][7]. Ninguno resulta decisivo por separado. Lo que hace valioso el conjunto es que cada uno falla en una dirección distinta y aun así coinciden.
El más difundido es también el más débil como prueba y el más útil como demostración. Un equipo del MIT Media Lab repartió a 54 participantes procedentes de cinco universidades del área de Boston en tres grupos —uno redactando ensayos con un gran modelo de lenguaje, otro con un buscador convencional y otro sin ayuda— y registró la actividad cerebral durante todo el proceso con un dispositivo de 32 electrodos que muestreaba a 500 hercios✓ Hecho establecido [3]. Los participantes disponían de 20 minutos y elegían entre temas filosóficos tomados de pruebas de admisión estandarizadas. El grupo sin ayuda mostró la conectividad neuronal más intensa y distribuida; el del buscador, una conectividad intermedia; el del modelo, la más débil✓ Hecho establecido [3].
El hallazgo que importa en ese estudio no es la medida de conectividad, difícil de interpretar y no revisada por pares en el momento de su difusión⚖ Controvertido [4]. Es el residuo conductual. Los participantes que redactaron con el modelo recordaban peor sus propios textos y declaraban un sentido de autoría más débil sobre ellos✓ Hecho establecido [3]. Los autores denominaron a ese patrón deuda cognitiva: una codificación superficial en el momento de producir, cuyo déficit solo se vuelve visible cuando hay que recuperar o defender el texto. Es exactamente la firma que la literatura sobre dificultades deseables predice para una herramienta que elimina el paso generativo◈ Evidencia sólida [17].
La evidencia de encuesta es más amplia y más tosca. El estudio de método mixto de Michael Gerlich sobre 666 participantes, publicado en Societies en enero de 2025, halló una asociación negativa significativa entre el uso frecuente de herramientas de IA y las puntuaciones de pensamiento crítico, estadísticamente mediada por la descarga cognitiva✓ Hecho establecido [5]. Los participantes más jóvenes mostraron mayor dependencia y puntuaciones más bajas; un nivel educativo alto amortiguaba la asociación✓ Hecho establecido [5]. El diseño es correlacional, autoseleccionado y autodeclarado, y no permite descartar que sean las personas con pensamiento crítico más débil quienes adoptan más estas herramientas⚖ Controvertido [5]. Es una hipótesis con 666 puntos de datos, no una demostración.
El experimento controlado de aprendizaje es el que aísla la variable. Yizhou Fan y sus colegas, en el British Journal of Educational Technology en 2025, compararon a aprendices apoyados por ChatGPT, por expertos humanos, por una herramienta de análisis de la escritura y sin apoyo alguno. El grupo de ChatGPT logró la mayor mejora en las notas de los ensayos. Su ganancia de conocimiento y su transferencia de conocimiento no fueron significativamente superiores a las de los demás grupos✓ Hecho establecido [7]. Los autores llamaron al mecanismo pereza metacognitiva: los aprendices seguían la retroalimentación del modelo para completar la tarea con eficacia, en lugar de implicarse en la evaluación y el seguimiento que producen comprensión transferible◈ Evidencia sólida [7].
Es el resultado mejor replicado de esta joven literatura y el de consecuencia política más clara. Las notas de los ensayos subieron en la condición de ChatGPT; la ganancia y la transferencia de conocimiento no difirieron significativamente de la condición sin apoyo✓ Hecho establecido [7]. El tiempo dedicado a contenidos matemáticos vulnerables a la IA cayó un 26,9 % acumulado entre universitarios, mientras la probabilidad de acertar en ítems de retención supervisados descendía un 25 %◈ Evidencia sólida [21]. Cualquier régimen de evaluación que mida el producto entregado en lugar de la capacidad retenida registrará, por tanto, una mejora precisamente en la población que menos aprende◈ Evidencia sólida [7][21].
Lo que los estudiantes delegan de verdad es la parte del trabajo que el temario más valora. El análisis de Anthropic sobre 574.740 conversaciones académicas en una ventana de 18 días, clasificadas según la taxonomía de Bloom, sitúa el 39,8 % de las consultas en la categoría superior, Crear, y el 30,2 % en Analizar, frente al 10,9 % de Aplicar y el 10,0 % de Comprender✓ Hecho establecido [23]. La delegación se invierte respecto de lo que suele suponerse: se conserva la rutina y se exporta el trabajo de orden superior. La muestra se inclinaba con fuerza hacia los adoptantes tempranos y la informática, que suponía el 38,6 % de los usuarios frente al 5,4 % de la población estudiantil estadounidense⚖ Controvertido [23].
Las instituciones responden a la IA generativa rediseñando la evaluación, y el 65 % de los estudiantes británicos declara que esta ya ha cambiado de forma notable✓ Hecho establecido [20]. Casi todo ese rediseño se orienta a detectar o impedir el texto producido por IA. La evidencia sitúa la exposición en otro lugar: la herramienta mejora el trabajo entregado y no mejora el conocimiento retenido✓ Hecho establecido [7][21]. Una institución que consiga autenticar la autoría y siga calificando el producto entregado habrá resuelto un problema de integridad dejando el problema de aprendizaje exactamente donde estaba.
La trayectoria comercial fija el ritmo de cualquier respuesta política. El mercado de la inteligencia artificial en educación se estima en unos 10.600 millones de dólares en 2026, frente a unos 7.500 millones en 2025, y se prevé que alcance cerca de 42.500 millones en 2030◈ Evidencia sólida [35]. La provisión institucional de estas herramientas a los estudiantes británicos pasó del 9 % al 38 % en dos años✓ Hecho establecido [20]. La contratación pública corre varios años por delante de la literatura de evaluación, patrón familiar en la tecnología educativa que hasta ahora nunca ha terminado bien⚖ Controvertido [26].
La pérdida de destreza fuera del aula
La medicina y la aviación hicieron este experimento primero, con instrumentos y consecuencias
La evidencia más sólida de que la asistencia mecánica degrada la destreza experta no procede en absoluto de la educación. Procede de dos profesiones que instrumentan su propio rendimiento de forma continua: la gastroenterología, donde las tasas de detección se auditan procedimiento a procedimiento, y la aviación comercial, donde la pérdida del pilotaje manual lleva dos décadas siendo una preocupación de seguridad identificada✓ Hecho establecido [1][31]. En ambas, la degradación se halló en profesionales que ya eran expertos.
Conviene reformular el estudio polaco precisamente porque su diseño resulta tan poco vistoso. Fue observacional, no aleatorizado. Diecinueve endoscopistas de cuatro centros, con más de 2.000 colonoscopias previas cada uno, fueron seguidos durante la implantación de la detección asistida por IA en sus instituciones, entre septiembre de 2021 y marzo de 2022✓ Hecho establecido [1]. La detección de adenomas en los procedimientos realizados sin asistencia cayó del 28,4 % al 22,4 %; los procedimientos asistidos se situaron en el 25,3 %✓ Hecho establecido [2]. La comparación se establece dentro del mismo operador y del mismo centro, lo que elimina la mayoría de las explicaciones alternativas que suelen engullir un resultado de esta magnitud.
El mecanismo propuesto es atencional más que mnémico. Un operador que trabaja junto a un sistema que señala lesiones candidatas reorienta paulatinamente su búsqueda visual del barrido exhaustivo hacia la confirmación de lo que el sistema produce. La destreza que se degrada no es el conocimiento del aspecto de un adenoma; es la búsqueda sostenida y autodirigida que encuentra uno que nadie ha señalado. Es el mismo cambio estructural que la literatura aeronáutica describe desde los años noventa: el paso de operador a supervisor, y los costes de vigilancia específicos que lo acompañan◈ Evidencia sólida [31].
Nuestros resultados son preocupantes dada la rápida difusión de la IA en medicina. Necesitamos con urgencia más investigación.
— Marcin Romanczyk, Academia de Silesia, en The Lancet Gastroenterology and Hepatology, agosto de 2025La aviación ofrece el experimento natural más prolongado del que se dispone. Las destrezas de pilotaje manual se degradan hasta los márgenes del rendimiento tolerable sin una práctica relativamente frecuente, y el control de la velocidad aerodinámica figura entre las primeras capacidades que se erosionan◈ Evidencia sólida [31]. La posición de la administración federal de aviación estadounidense, adoptada tras una serie de investigaciones de pérdidas de control en vuelo, es que la automatización exige más formación y no menos, que el dominio del pilotaje manual sigue siendo primordial para la seguridad y que los pilotos deberían volar a mano en porciones sustanciales de los vuelos comerciales, en condiciones adecuadas✓ Hecho establecido [31]. Un regulador ordena aquí a unos profesionales renunciar deliberadamente a una herramienta disponible para preservar la capacidad que esa herramienta sustituye.
| Exposición | Gravedad | Valoración |
|---|---|---|
| Erosión del rendimiento experto sin asistencia | Demostrada en la única profesión que se audita procedimiento a procedimiento: seis puntos de caída en la detección de adenomas sin asistencia tras tres meses de exposición, en operadores con más de 2.000 procedimientos cada uno✓ Hecho establecido [1]. La exposición es máxima allí donde la asistencia es continua, donde el rendimiento no se mide por separado sin ella y donde la destreza descansa en una búsqueda sostenida y autodirigida◈ Evidencia sólida [31]. | |
| Pérdida de capacidad manual en sistemas automatizados | El pilotaje manual se degrada rápido sin práctica frecuente, y una experiencia manual insuficiente ha figurado entre los factores contribuyentes en investigaciones de pérdida de control◈ Evidencia sólida [31]. El remedio regulatorio, volar a mano de forma deliberada en operación normal, constituye la admisión explícita de que la herramienta debe rechazarse periódicamente para que la capacidad sobreviva✓ Hecho establecido [31]. | |
| Profesionales que nunca adquieren la línea de partida | Todos los resultados de pérdida de destreza conocidos hasta la fecha se refieren a expertos que poseían antes la destreza. Nadie ha medido aún una cohorte formada desde el inicio bajo asistencia continua⚖ Controvertido [1]. La excepción del cuarto curso es el análogo más próximo, y apunta en la dirección equivocada: la asistencia sostenida durante la formación de un procedimiento entorpeció ese procedimiento✓ Hecho establecido [13]. | |
| Confianza desacoplada de la competencia | Una mayor confianza en el sistema de IA predice menor escrutinio crítico de sus resultados, mientras que una mayor confianza en la propia destreza predice más✓ Hecho establecido [6]. Como la descarga degrada además la señal metacognitiva con la que se juzga la propia aptitud, la población menos capaz de detectar el déficit es la más expuesta a él◈ Evidencia sólida [12]. | |
| Ceguera institucional a la medición | Casi ninguna institución mide el rendimiento sin asistencia una vez desplegada esta. El resultado polaco existe solo porque se siguieron realizando y registrando colonoscopias sin asistencia dentro de un ensayo✓ Hecho establecido [1]. Donde no se recoge el contrafáctico, la degradación no está meramente sin detectar: resulta indetectable◈ Evidencia sólida [21]. |
La generalización topa con un límite duro que conviene enunciar antes de que alguien la extienda. Todos los resultados de pérdida de destreza obtenidos hasta ahora se refieren a profesionales que adquirieron la destreza antes de la llegada de la herramienta. No existe medición publicada de una cohorte formada bajo asistencia continua desde el principio, en profesión alguna⚖ Controvertido [1]. Cabe que tal cohorte desarrolle una competencia distinta e igual de eficaz, organizada en torno a la herramienta. Cabe también que nunca adquiera la línea de partida frente a la cual los errores de la herramienta resultan detectables. Son dos hipótesis. Ninguna se ha puesto a prueba, y es la segunda la que importaría.
Es la asimetría de las consecuencias lo que justifica regular por delante de la evidencia. En educación, una capacidad degradada produce un titulado que se desenvuelve aceptablemente con herramientas y mal sin ellas, en un mundo que por lo general las suministra. En medicina y aeronáutica, el fallo de la herramienta y la capacidad de reserva degradada del humano son sucesos correlacionados: se recurre al operador precisamente cuando el sistema ha dejado de funcionar◈ Evidencia sólida [31]. Una redundancia que se degrada en proporción a su desuso no es una redundancia. Es un punto único de fallo diferido.
El hallazgo polaco solo resulta visible porque un protocolo de investigación exigía que siguieran realizándose colonoscopias sin asistencia mientras la asistencia estaba disponible✓ Hecho establecido [1]. Casi ningún despliegue fuera de un ensayo preserva esa comparación. Los hospitales no retiran periódicamente el apoyo diagnóstico para auditar el rendimiento sin ayuda; los centros escolares no evalúan sin dispositivos para medir qué sostienen esos dispositivos; las empresas no comparan a su personal con su propia producción anterior al despliegue. La intervención más barata disponible en todos estos entornos consiste en seguir midiendo el caso sin asistencia◈ Evidencia sólida [21].
Lo que la medicina y la aviación aportan es una prueba de principio a escala profesional. La destreza se degrada cuando la operación que la mantenía la ejecuta otra cosa, esa degradación se mide en meses y no en décadas, y ocurre en poblaciones cuya pericia no está en duda✓ Hecho establecido [1][31]. Ninguno de los dos campos concluyó que hubiera que abandonar la herramienta: la colonoscopia asistida detecta más adenomas que la no asistida, y por eso se adoptó✓ Hecho establecido [2]. Ambos concluyeron que la capacidad humana debe mantenerse por separado, de forma deliberada, a contracorriente de la comodidad de la herramienta.
Cinco Estados, cinco apuestas opuestas
China obliga, Estonia reparte, Corea del Sur rectifica y casi nadie ha diseñado una evaluación
Las respuestas nacionales a la cognición asistida por máquina han divergido con más nitidez de la que justifica la evidencia, porque la evidencia llegó después de la mayoría de las decisiones. China ha convertido la inteligencia artificial en asignatura escolar obligatoria desde los seis años y prohíbe al alumnado de primaria usar por su cuenta los sistemas generativos✓ Hecho establecido [27]. Estonia reparte modelos de frontera a todo su alumnado de bachillerato✓ Hecho establecido [28]. Corea del Sur eliminó por ley, en agosto de 2025, su programa emblemático de libros de texto con IA✓ Hecho establecido [26].
El Ministerio de Educación chino publicó en mayo de 2025 dos directrices que convierten la enseñanza de la IA en infraestructura obligatoria. El plan de estudios arranca a los seis años con un suelo de al menos ocho horas anuales de contenidos adaptados a la edad, avanza por los datos y la programación en cuarto curso hacia los algoritmos y los agentes inteligentes en quinto, y alcanza la lógica del aprendizaje automático y la detección de desinformación en secundaria inferior✓ Hecho establecido [27]. Pekín hizo la asignatura obligatoria para todo el alumnado de primaria y secundaria inferior✓ Hecho establecido [27]. Esas mismas directrices prohíben a los niños de primaria usar los sistemas generativos por su cuenta y vedan al profesorado sustituir con ellos la enseñanza troncal✓ Hecho establecido [27].
Esa combinación es la política internamente más coherente que haya adoptado ningún Estado. Trata la tecnología como objeto de estudio y no como sustituto del estudio, y sitúa la prohibición exactamente donde la colocaría la evidencia sobre calculadoras en cuarto curso: durante la formación de los procedimientos que se automatizan◈ Evidencia sólida [13]. Que el suelo de ocho horas resulte significativo y que la prohibición sobreviva al contacto con 190 millones de escolares son cuestiones distintas, y ninguna se ha evaluado. Lo llamativo es que la estructura de la política reproduce la de la evidencia, al parecer por razonamiento y no por casualidad.
Estonia ha hecho la apuesta contraria con igual determinación. El programa AI Leap, lanzado el 1 de septiembre de 2025, ofrece acceso gratuito a las principales aplicaciones de IA y formación en las competencias asociadas a 20.000 alumnos de los cursos décimo y undécimo y a 3.000 docentes, con una segunda oleada prevista que añadirá 38.000 alumnos y 2.000 docentes✓ Hecho establecido [28]. El programa se negoció directamente con los desarrolladores de modelos de frontera y se presenta explícitamente como sucesor de la iniciativa Tiger Leap, que llevó ordenadores a las escuelas estonias hace tres décadas✓ Hecho establecido [28]. Apunta a una franja de edad muy posterior a la zona de peligro del cuarto curso.
Corea del Sur aporta el caso de advertencia, y es un fracaso de contratación más que pedagógico. Los libros de texto digitales con IA se pilotaron en el primer semestre de 2025 para inglés y matemáticas en tercero y cuarto de primaria, y para inglés, matemáticas e informática en secundaria✓ Hecho establecido [26]. Ante la oposición sostenida de docentes y familias, el ministerio pasó de un mandato nacional a la adopción voluntaria centro a centro; el 4 de agosto de 2025, la Asamblea Nacional restringió la definición legal de libro de texto a los libros impresos y electrónicos, excluyendo el software inteligente de apoyo al aprendizaje✓ Hecho establecido [26]. La adopción cayó del 37 % al 19 % en un solo semestre✓ Hecho establecido [26].
La oleada de restricción de dispositivos es una política distinta que aborda un mecanismo distinto, y su base probatoria es delgada, aunque no vacía. Las restricciones existen ya en 106 países y 39 Estados de Estados Unidos✓ Hecho establecido [36]. En Países Bajos, una encuesta a 317 centros de secundaria tras la prohibición nacional halló que tres cuartas partes reportan mejor concentración, cerca de dos tercios un mejor clima social y un tercio mejores resultados académicos◈ Evidencia sólida [25]. Un estudio de 2025 encontró mejores notas allí donde el profesorado recogía los teléfonos, con las ganancias mayores entre el alumnado de primer curso con peor rendimiento y el de itinerarios no científicos◈ Evidencia sólida [25]. La valoración de la UNESCO sigue siendo que los resultados son dispares y que la restricción no exime de enseñar a navegar entornos digitales⚖ Controvertido [24].
El artículo 4 del Reglamento de Inteligencia Artificial pasó a ser aplicable el 2 de febrero de 2025: todo proveedor y todo responsable del despliegue debe adoptar medidas que garanticen un nivel suficiente de alfabetización en IA entre su personal y las demás personas afectadas, proporcionado a su papel, su competencia y los sistemas implicados✓ Hecho establecido [29]. La obligación es real y general. Lo que no precisa son las capacidades humanas que esa alfabetización debe preservar, laguna que importa porque la evidencia sobre pérdida de destreza versa sobre la erosión del oficio, no sobre la comprensión de la herramienta◈ Evidencia sólida [1]. Saber cómo funciona un modelo no mantiene la conducta de búsqueda que ese modelo sustituye.
El fracaso común a los cinco enfoques es evaluativo más que ideológico. Ninguno de estos programas se puso en marcha con un diseño preinscrito capaz de detectar el efecto que importa: la capacidad sin asistencia, medida a lo largo de años, frente a una cohorte comparable. La próxima ronda de la evaluación internacional del alumnado de la OCDE, cuyos resultados se esperan en septiembre de 2026 sobre más de 760.000 estudiantes en 91 países, incluirá por primera vez evidencia sobre cómo usan los alumnos la IA en el trabajo escolar◈ Evidencia sólida [34]. Es el único instrumento grande apuntado hoy a la cuestión, y es observacional.
Lo que la evidencia puede sostener
La variable no es la herramienta, sino el paso que retira
Dos proposiciones sobreviven a la auditoría. La descarga es una estrategia antigua, racional y en gran medida benigna, que se ha confundido repetidamente con un declive◈ Evidencia sólida [12][32]. Y las herramientas que sustituyen al paso de recuperación o de generación degradan de forma mensurable la capacidad que sustituyen, en adultos, en cuestión de meses y en niveles profesionales de pericia✓ Hecho establecido [1][8]. No son afirmaciones rivales. Describen herramientas distintas, y toda la cuestión práctica consiste en determinar a cuál de las dos se parece un despliegue concreto.
La tesis de una descarga adaptativa se apoya en el tipo de evidencia más sólido del que dispone este campo: la falsación histórica reiterada de la alarma. La escritura no degradó la civilización✓ Hecho establecido [32]. Las calculadoras mejoraron el rendimiento matemático en todos los cursos salvo uno y las actitudes en todos ellos✓ Hecho establecido [13]. El resultado del bolígrafo frente al teclado, esgrimido durante una década como prueba de que los soportes digitales dañan la codificación, fracasó dos veces en replicación directa⚖ Controvertido [15][16]. El experimento más citado del efecto Google no se replicó⚖ Controvertido [11]. Un campo con semejante historial de sobreinterpretación se ha ganado el escepticismo respecto de su afirmación más reciente.
La tesis de una descarga corrosiva descansa en un cuerpo más reducido pero mejor identificado. El resultado sobre navegación por satélite cuenta con un componente longitudinal y con una explicación alternativa puesta a prueba◈ Evidencia sólida [8]. El resultado sobre colonoscopia se establece dentro del mismo operador y del mismo centro, y versa sobre expertos✓ Hecho establecido [1]. La posición aeronáutica es la conclusión de un regulador tras investigar accidentes, no un hallazgo de laboratorio✓ Hecho establecido [31]. El experimento de Fan separa la calidad del producto entregado de la transferencia de conocimiento en condiciones controladas✓ Hecho establecido [7]. Ninguno de estos trabajos es una encuesta autodeclarada sobre el propio pensamiento, que es de lo que se compone hoy la mayor parte de la literatura alarmista sobre IA.
La reconciliación es la regla del cuarto curso generalizada. La asistencia aplicada a una operación que el usuario ya ha automatizado es casi gratuita, y a menudo mejor que gratuita, porque libera capacidad para el siguiente nivel de la tarea✓ Hecho establecido [13][14]. La asistencia aplicada a una operación que el usuario aún no ha automatizado ocupa el hueco donde se habría formado el automatismo✓ Hecho establecido [13]. La asistencia aplicada a una operación automatizada hace años, y aplicada sin interrupción, deja que ese automatismo decaiga✓ Hecho establecido [1][8]. Misma herramienta, tres poblaciones, tres signos.
Argumentos a favor de una descarga adaptativa
Sócrates predijo que la escritura destruiría la memoria; las sociedades letradas se volvieron más capaces, no menos✓ Hecho establecido [32]. Cada reedición posterior del argumento ha señalado a una tecnología hoy considerada manifiestamente beneficiosa.
Setenta y nueve estudios sobre calculadoras hallan mejores destrezas de lápiz y papel en todos los cursos salvo el cuarto, y mejor actitud y autoconcepto en todos✓ Hecho establecido [13].
El componente más citado del efecto Google fracasó en una replicación de alta potencia⚖ Controvertido [11], y la ventaja de los apuntes manuscritos fracasó en dos replicaciones directas⚖ Controvertido [15][16].
Se descarga más cuando la demanda interna es alta y menos cuando se juzga suficiente la propia capacidad: una estrategia, no un reflejo◈ Evidencia sólida [12].
La comprensión lectora adulta ya se estancaba en el conjunto de la OCDE a lo largo de una década✓ Hecho establecido [18], y la inversión del efecto Flynn se midió entre 2006 y 2018, antes de que existieran los grandes modelos de lenguaje✓ Hecho establecido [22].
Argumentos a favor de una descarga corrosiva
Diecinueve endoscopistas con más de 2.000 procedimientos cada uno perdieron seis puntos porcentuales de detección sin asistencia tras la exposición rutinaria a la IA✓ Hecho establecido [1].
Un uso más intenso de la navegación por satélite predijo un deterioro más rápido a tres años de la memoria espacial dependiente del hipocampo, con la explicación por causalidad inversa puesta a prueba y descartada◈ Evidencia sólida [8].
Las notas de los ensayos subieron en la condición de ChatGPT; la ganancia y la transferencia de conocimiento no difirieron significativamente de la condición sin apoyo✓ Hecho establecido [7].
El tiempo de estudio en contenidos matemáticos vulnerables a la IA cayó un 26,9 % acumulado entre universitarios, con un descenso del 25 % en la probabilidad de acertar en ítems de retención supervisados◈ Evidencia sólida [21].
Tres proposiciones hoy en circulación carecen de respaldo y deberían retirarse. Que la IA generativa esté rebajando de forma mensurable la inteligencia: las series cognitivas poblacionales que caen empezaron a caer antes de que existiera la tecnología✓ Hecho establecido [22][18]. Que los buscadores hayan vaciado la memoria: la forma fuerte del efecto Google no sobrevivió a la replicación⚖ Controvertido [11]. Y que la fricción sea intrínsecamente valiosa en el aprendizaje: los efectos de dificultad deseable se atenúan o se invierten cuando la memoria de trabajo ya está saturada⚖ Controvertido [17]. Cada una es un hallazgo real estirado más allá de lo que su diseño puede soportar.
Lo que se sigue en la práctica es estrecho y poco vistoso. Retirar la asistencia durante la formación de los procedimientos que se automatizan, que es donde se sitúa el único resultado negativo claro de la literatura sobre calculadoras✓ Hecho establecido [13]. Mantener deliberadamente el rendimiento sin asistencia en todo entorno donde el humano actúe de reserva, que es lo que concluyó el regulador aeronáutico y lo que implica el hallazgo sobre colonoscopia✓ Hecho establecido [31][1]. Y, por encima de todo, seguir midiendo el caso sin asistencia, porque es la única observación que vuelve visible el efecto y la primera que todo despliegue deja de recoger◈ Evidencia sólida [21].
La descarga cognitiva no es un fenómeno único con un efecto único, y por eso cuarenta años de estudios parecen contradecirse◈ Evidencia sólida [12]. La variable que los reconcilia no es la sofisticación de la herramienta, sino la posición del paso retirado respecto de la competencia que el usuario ya posee. Retire un paso que el usuario tenga automatizado y liberará capacidad✓ Hecho establecido [13]. Retire un paso que esté automatizando y impedirá la automatización✓ Hecho establecido [13]. Retire sin interrupción un paso automatizado hace años y dejará que decaiga✓ Hecho establecido [1][8]. Los grandes modelos de lenguaje son la primera herramienta de despliegue masivo capaz de ocupar las tres posiciones a la vez, en la misma persona y en la misma tarde.
Las preguntas mensurables de los próximos cinco años están ya formuladas. Si una cohorte formada desde el inicio bajo asistencia continua llega siquiera a adquirir la capacidad de partida, algo que ningún estudio ha examinado⚖ Controvertido [1]. Si el retroceso de la retención visible en el panel de matemáticas resiste diseños que no sean cuasiexperimentales⚖ Controvertido [21]. Si la evaluación internacional prevista para septiembre de 2026 detecta algo en la primera cohorte que la afronte con estas herramientas de uso corriente◈ Evidencia sólida [34]. Y si alguna institución, en cualquier lugar, opta por seguir recogiendo la medición sin asistencia una vez que deje de estar obligada. Con la evidencia actual, esa última es la restricción que aprieta.