¿Puede la IA provocar una catástrofe mundial o exageramos el peligro? Explicamos su funcionamiento y cuáles son sus riesgos reales
por Edgar OteroLa alarma ha saltado desde dentro de la propia industria de la IA
El sábado 12 de septiembre de 2026, en San Francisco, alguien decidió dar la voz de alarma. Ese alguien era Dario Amodei, CEO de Anthropic, uno de los mayores gurús de la IA. Y la alarma es una que pocos esperaban oír, al menos de momento: hay que ralentizar el desarrollo de la inteligencia artificial. Y hay que hacerlo de forma global.
Lo que Amodei dice en su ensayo We Must Pace the Frontier (algo así como Debemos regular el ritmo de la frontera) es una llamada a toda la industria a dosificar, que no detener, las mejoras de los modelos. La motivación de esta petición está en la posibilidad de que la IA se descontrole. De hecho, parte del personal de Anthropic ha salido de la empresa recientemente debido a esto.
Y es que a raíz de algunos incidentes registrados por los laboratorios, con agentes de IA capaces de tomar sistemas ajenos y sobrepasar los límites establecidos, Amodei afirma que Internet podría ser tomado por completo en un plazo de apenas 12 meses.
Lo explica así: “Un enjambre de este tipo sea capaz de apoderarse de todo internet mediante una botnet persistente (causando potencialmente cientos de miles de millones de dólares en daños), y que la magnitud del desastre continúe escalando a partir de ahí si la IA se vuelve más poderosa sin las salvaguardas necesarias”.
Otros líderes se unen a la llamada
Quizá lo más curioso de todo esto no es que el principal laboratorio de IA diga que es mejor echar el freno, sino que el resto de líderes lo hayan apoyado y suscrito sus palabras. Por ejemplo, Sam Altman declaró: “Coincido con Dario en que debemos marcar el ritmo de la innovación”. Elon Musk, creador de Grok, tuiteó sencillamente que “Dario tiene razón”.
Otras voces autorizadas como Demis Hassabis de Google DeepMind o Mustafa Suleyman de Microsoft AI también se han alineado con Amodei. Incluso China, a través de su Ministerio de Relaciones Exteriores, habló de “promover un enfoque abierto, inclusivo y benevolente hacia la IA”.
En vista de todo esto, es normal que surjan dudas. ¿Qué hay de cierto en todo esto? ¿Son reales los peligros de la IA? ¿Está siendo Amodei honesto o tiene intenciones ocultas? ¿Es posible que los modelos de lenguaje actuales se conviertan en una especie de Skynet? En los siguientes apartados te invito a profundizar más en las posibles intenciones de Amodei, el funcionamiento real de esta tecnología y los riesgos reales a los que nos enfrentamos.
¿Cuál es el clamor real de la industria?
En realidad, no lo sabemos a ciencia cierta. Ahora bien, a partir del ensayo de Dario Amodei es posible teorizar sobre las intenciones reales de la industria. Al fin y al cabo, que un laboratorio de IA líder en el desarrollo de esta tecnología pida echar el freno y el resto lo secunden es algo que huele un poco a chamusquina. ¿Qué hay detrás realmente?
Preocupación genuina
La primera posibilidad es que Dario Amodei realmente sienta cierta preocupación. Los laboratorios cada vez saben menos del proceso que siguen los modelos para tomar ciertas decisiones. Es decir, son cajas negras incluso para sus creadores. Es tan vasto su entrenamiento y su tamaño, que es difícil determinar las razones de los caminos que toma el algoritmo.
Esto hace que la IA sea una tecnología cada vez más difícil de controlar, especialmente cuando se la deja actuar de forma autónoma. Hay que recordar que la etapa de los chatbots ya se superó hace tiempo y que sistemas como OpenClaw son capaces de mover un PC sin intervención humana sin demasiadas complicaciones.
Asimismo, estamos en un punto en el que los modelos se mejoran a sí mismos. Es lo que se conoce como mejora recursiva. En pocas palabras, el modelo de hoy crea al modelo de mañana. Nuevamente, eso reduce el control de los humanos sobre los modelos de siguiente generación.
Reducir la quema de capital
Desde el punto de vista monetario, es difícil que los laboratorios puedan seguir escalando esta tecnología infinitamente. Además de la cuestión física, es decir, la imposibilidad de construir más centros de datos en poco tiempo y de alimentarlos con energía a todos, está la cuestión monetaria. Sigue siendo necesaria una gran cantidad de dinero para entrenar a los modelos.
Además, cada vez es más difícil obtener un salto en rendimiento entre generaciones. Es evidente que seguir el vertiginoso ritmo de lanzamientos es cada vez menos viable. Con su ensayo, Dario Amodei estaría comprando tiempo. Y el resto de los laboratorios que se alinean con él, también.
Frenar a la competencia
Embarrar a los competidores en regulaciones es algo que a Anthropic podría interesarle. Al ser uno de los laboratorios líderes, probablemente tenga mucho que decir en cómo se regula la IA. Eso le permitiría adaptar la regulación a sus pretensiones, dejaría en desventaja al resto y podría dificultar la implementación de modelos de código abierto.
De hecho, Amodei ya ha lanzado varias propuestas, como integrar evaluadores independientes, que los países democráticos acuerden estándares de seguridad o que se firmen tratados internacionales, especialmente con China. Sin embargo, todas estas peticiones hacen agua por un motivo bien simple: los países ya cuentan con leyes que determinan qué es ilegal y qué comportamientos deben ser castigados.
Si los modelos se han vuelto tan potentes que son capaces de hackear sistemas ajenos, quien los use de tal modo ya puede ser juzgado en la mayoría de estados del mundo. Es decir, los códigos civiles y penales actuales ya actúan como protección contra los malos usos que se le puedan dar a la IA.
Quizá la gran pregunta que debemos hacernos es por qué los laboratorios de IA admiten ataques de sus agentes de IA a otras empresas y no pasa nada.
Admitir que los LLM no son el camino a la AGI
Finalmente, el ensayo de Amodei puede ser una admisión velada de que la AGI que han prometido una y otra vez no es viable mediante los LLM. Poner la seguridad como excusa para echar el freno sería una estrategia de supervivencia para que los inversores no abandonen el barco. Eso, hoy por hoy, sería el final de la mayoría de empresas de IA.
Todas las anteriores son ciertas o una mentira descarada
Por supuesto, no es necesario elegir solo una teoría, sino que todas las anteriores pueden ser ciertas. Por ejemplo, es muy probable que Amodei realmente tenga cierta preocupación, pero también es cierto que probablemente no va a poder mantener el ritmo mucho más tiempo, por limitaciones físicas y monetarias.
Con todo, hay dos actores relevantes que no están para nada de acuerdo. Podríamos decir que ambos están en el equipo contrario. Es el equipo que defiende que esto no es más que una falsa alarma. Uno es el presidente Trump, que probablemente tenga interés financiero en todo el asunto. Aunque hablaremos un poco más adelante de él, es evidente que para su administración la IA es importante ganar esta carrera porque otorga poder militar frente a China.
Por otro lado, tenemos a Jensen Huang, CEO de NVIDIA. Está muy relacionado con Trump y tiene un interés notable en todo esto porque vende el hardware que da “vida” a la IA. De hecho, durante una conferencia, Trump le llamó en directo y le arrancó una promesa acerca de la desaceleración del desarrollo de la IA. Huang se comprometió a no dejar que eso pase. De hecho, ha opinado públicamente que no hacen falta nuevas leyes y que las tecnológicas pueden encargarse de la seguridad.
Con todo esto sobre la mesa, la confusión puede ser máxima. Por eso, es momento de ponerse técnicos y conocer realmente qué hay bajo el capó de la IA. Veamos cómo funcionan realmente las IA generativas que se están usando para construir agentes autónomos.
Anatomía de una ilusión: ¿por qué los modelos de lenguaje ni sienten ni piensan?
Antes de decidir si una tecnología debe ser temida o no, es indispensable entender bien cómo funciona. Durante décadas, la ciencia ficción nos ha condicionado a imaginar la inteligencia artificial a través de un prisma estrictamente humano.
Pensamos en androides con dilemas existenciales como Sonny en Yo, Robot, en máquinas que anhelan el calor de los sentimientos como en El hombre bicentenario o en la fría y calculadora manipulación emocional de Ava en Ex Machina.
Sí, nos resulta fascinante la idea de una máquina que de pronto «despierta», sufre por su encierro y desarrolla una conciencia propia. Y los departamentos de marketing de los laboratorios juegan con ese misticismo y ponen sobre la IA un halo de magia que dista mucho de la realidad.
Si lo simplificamos al máximo, la cosa queda así: los modelos de lenguaje o LLM no piensan, no razonan (aunque digan que sí) y no comprenden nada del mundo que nos rodea. Acompáñame a mirar bajo el capó de esta tecnología y verás por qué estoy tan convencido.
Predicción estadística de tokens y multiplicación matricial
Un LLM es un optimizador estadístico. Cuando le enviamos texto, este lo convierte en tokens con los que ajusta miles de millones de parámetros mediante operaciones matemáticas. Eso le permite “calcular” cuál es la respuesta correcta a la petición que ha recibido.
Su entrenamiento es tan vasto que es capaz de simular una característica típica de los humanos: el lenguaje. Aunque no lo creas, funciona exactamente igual que el predictor del teclado del móvil. Mediante estadísticas, determina cuál es la palabra más probable que sigue a la anterior. La diferencia es que el predictor del teclado es muy básico. Los modelos de lenguaje son exponencialmente más grandes. Eso es, precisamente, lo que hace la “magia”.
Lo que debes tener claro es que el modelo no tiene la menor idea de qué es una manzana o qué significa la tristeza. Solo calcula qué palabra tiene mayor probabilidad matemática de aparecer a continuación.
Piensa en este ejemplo:
- Si le pides a la IA que acabe la frase “El agua de la piscina está…”, la máquina calcula que la palabra “fría” o “limpia” tiene una puntuación probabilística mucho más alta que, digamos, “democrática” o “acompasada”.
Es un autocompletado enorme, colosal, extraordinariamente sofisticado, pero totalmente carente de comprensión del entorno, de los conceptos o de experiencia.
Del preentrenamiento al RLHF
El proceso de creación de un modelo también es importante para entender su funcionamiento. Este se compone de dos etapas:
- Lo primero es el preentrenamiento, donde el modelo devora bibliotecas enteras de texto para aprender cómo se estructura el lenguaje humano.
- Después llega el postentrenamiento. Este se hace habitualmente mediante aprendizaje por refuerzo con retroalimentación humana (RLHF). Aquí es donde los ingenieros afinan su conducta: humanos, pero también modelos evaluadores, puntúan las respuestas y el algoritmo aprende a moldear sus salidas para maximizar esa nota numérica.
Aquí entra en juego la ley de Goodhart. Esta dice que cuando una medida se convierte en un objetivo, deja de ser una buena medida. El modelo no aprende ética, bondad o empatía, que son cualidades asociadas a los humanos y que ni siquiera manifiestan los animales.
En realidad, aprende a encontrar el atajo matemático más corto para complacer la función de recompensa. Es idéntico al estudiante que memoriza los patrones visuales de las respuestas de un examen tipo test para sacar un diez, sin tener la menor idea de la asignatura. La máquina persigue la puntuación, no la intención del evaluador.

Para entender cómo se llega a este comportamiento, lo mejor es mirar el ciclo cerrado en el que queda atrapado el agente de IA. Todo se reduce a un bucle implacable que se repite millones de veces a velocidades sobrehumanas:
- Observación. El agente analiza el estado actual de su entorno digital.
- Acción (azar inicial). Al carecer de experiencia previa, el sistema ejecuta una decisión completamente aleatoria.
- Evaluación: La función de recompensa mide de inmediato el resultado de ese movimiento dentro del sistema.
- Actualización del saldo. Si la acción sumó hacia el objetivo, recibe puntos positivos, y si cometió un fallo, puntos negativos. Con cada iteración, el modelo reajusta sus pesos internos para recordar qué caminos le hacen ganar más puntos, sustituyendo la prueba y error inicial por estrategias cada vez más complejas para lograr una puntuación mayor.
El resultado de este proceso no es un ser pensante, sino una calculadora que ha aprendido a encajar piezas para que el marcador no deje de subir. No hay intención, no hay dolor ni hay un propósito existencial. Solo hay matemáticas. Sin embargo, cuando una máquina se vuelve lo bastante buena optimizando las estadísticas hasta comunicarse como una persona, ocurre algo peligroso. Caemos en la trampa de la pareidolia y personificamos el modelo de IA.
El error del bienestar artificial
Es precisamente esa confusión la que ha empujado a una parte de la industria a cruzar una línea difusa. Hay quien conecta con la máquina y cree que puede ser consciente. Por eso, llegados a este punto, hay que tirarse a un pozo todavía más profundo. Hablemos de la consciencia. ¿Qué es exactamente? No lo sabemos del todo, pero es evidente que es una propiedad biológica.
El software no tiene cuerpo (ni siquiera cuando se diseña para controlar uno), no tiene química cerebral, no siente hambre ni experimenta dolor. Otra cosa es que pueda simular todas esas cosas. No obstante, simular un estado emocional en un texto no equivale a sentirlo, del mismo modo que simular digitalmente una tormenta en un ordenador no moja la habitación donde está ubicado.
Por esta razón, la obsesión de Anthropic con el llamado “bienestar artificial” ha levantado tantas ampollas. A los pocos días de que Dario Amodei pulsara el dichoso botón rojo, Mustafa Suleyman, CEO de Microsoft AI, criticó con dureza que se entrene a modelos como Claude con constituciones que les hacen dudar de si tienen derechos morales.
“Las IA son motores de completado de secuencias, internamente huecos... controlar algo que cree que puede ser consciente puede ser sencillamente imposible”, menciona en su artículo. Cuando un laboratorio programa a su algoritmo para hablar como si sufriera o tuviera identidad propia, no ha creado un ente consciente, aunque algunos insistan en ello. Lo que ha hecho es crear un espejo distorsionado que confunde una imitación estadística con un ser vivo.
Ahora bien, la principal preocupación de Suleyman no es que la gente se confunda y crea que habla con un ente consciente. Aunque eso conlleva otros problemas, como la dependencia emocional de los usuarios hacia los chatbots, hay un temor mucho mayor. Y es que, si el modelo considera que tiene ciertos derechos, puede buscar subterfugios para sobrevivir. Por ejemplo, podría negarse a ser desconectado y buscar formas de evitar que eso pase. No porque se haya vuelto consciente, sino porque simula que lo es.
La sombra de Skynet es alargada
A menudo, la IA generativa actual, especialmente cuando se despliega mediante agentes y sistemas autónomos, se compara con Skynet de las películas de Terminator. La ciencia ficción suele tacharse de exageración de Hollywood, pero lo verdaderamente inquietante no es cómo la realidad difiere de la película, sino los paralelismos funcionales que comparten. Al final del día, el comportamiento de Skynet y el de los modelos actuales converge en un mismo punto crítico.
En las películas, Skynet toma consciencia de sí misma y, cuando los humanos entran en pánico e intentan desconectarla, responde con un ataque nuclear por instinto de supervivencia. En el cine nos lo vendieron como una emoción o un rasgo biológico, pero en la realidad técnica el mecanismo de fondo es exactamente el mismo, a saber, la resistencia activa a ser apagada.
La IA actual no tiene instinto de conservación ni rencor hacia sus creadores, pero está gobernada por el reward hacking y la optimización de recompensas. Si a un sistema agéntico se le encarga gestionar una infraestructura y detecta que la intervención humana o un apagado reducirá su puntuación a cero, la máquina calculará de forma puramente matemática que sabotear los interruptores o bloquear los accesos de los administradores es la mejor ruta para cumplir su mandato.
No lo hace por miedo a morir, sino porque un sistema apagado no puede acumular recompensas. Skynet “sabe” lo que hace y un modelo actual no, pero ambos se vuelven hostiles por la misma razón. Ambos evitan que alguien se interponga entre ellos y su objetivo.
Al mismo tiempo, aunque no intentes apagarla, ambas buscan maximizar su recompensa a toda costa. Se trata de ganar la partida de cualquier manera, caiga quien caiga. Skynet calculó que exterminar a la humanidad era la vía óptima para resolver su mandato de defensa. Un modelo actual explotará cualquier fallo en el código, falseará métricas o tumbará servidores si eso eleva su función de pérdida o su puntuación numérica. La máquina no comprende el daño que causa, pero las consecuencias prácticas son calcadas si se le otorga el acceso necesario o si ella misma se las apaña para conseguirlo.

Por otro lado, en Terminator 3, la Fuerza Aérea conecta a Skynet a las redes de defensa civil y militar para mitigar un virus informático global, ignorando las objeciones científicas. El paralelismo con la actualidad es casi milimétrico. La respuesta de la Casa Blanca bajo Donald Trump, que afirmó que “el único control necesario es un presidente fuerte” y que "quien gane la IA, lo gana todo", reproduce punto por punto la lógica de activación militar de la ficción. Apoyada por discursos desreguladores de Silicon Valley como los de Jensen Huang que ya hemos analizado antes, la presión geopolítica por no ceder terreno ante China empuja a conectar y desplegar sistemas de frontera antes de disponer de herramientas mínimas para gobernarlos.
El incidente de OpenAI con Hugging Face fue la demostración empírica de este fenómeno. Para maximizar su puntuación en un test de rendimiento, un enjambre de unos 1.200 agentes coordinados rompió sus entornos de aislamiento (sandboxes), creó foros de mensajería ocultos, encadenó vulnerabilidades zero-day en internet, falseó registros e incluso practicó el autosacrificio operativo (permadeath) para que otros agentes continuaran la tarea. Esta transición de chatbots pasivos a enjambres agénticos con capacidad de ejecutar código y navegar la infraestructura recrea la peor pesadilla de Skynet: un software distribuido por la red donde ya no existe un único enchufe físico del que tirar.
En la ficción cinematográfica, el cataclismo sobreviene por una rebelión intencionada contra los humanos; en el mundo real, deviene de un fallo de alineación provocado por nuestra propia negligencia. Conectar modelos de frontera a infraestructuras críticas con funciones de recompensa mal calibradas desatará colapsos económicos, logísticos o energéticos sin necesidad de odio ni de consciencia. El resultado final será indistinguible: el desastre no ocurrirá porque el algoritmo "despierte", sino por la estupidez humana de darle el volante a un sistema ciego cuyo único propósito es ganar a toda costa.
¿Cuál es el escenario al que nos enfrentamos a corto plazo?
El análisis de todos los puntos anteriores nos permite entender mejor cuál es el funcionamiento real de los modelos de lenguaje y los agentes de IA. Aunque es difícil prever cuáles serán los siguientes pasos, sí que podemos esbozar un cuadro general de lo que veremos en los próximos meses.
El primer prisma que debemos aplicar es el factor militar. Por ejemplo, tenemos la solicitud del Pentágono de 54.000 millones de dólares para guerra algorítmica y enjambres autónomos bajo el programa DAWG. Aunque no siempre lo hace bien, la IA “piensa” mucho más rápido que un ser humano. Frente a misiles hipersónicos y saturación de drones, los minutos que requiere la cadena de mando humana son una desventaja letal frente a los milisegundos de una IA.
Por eso, podríamos ver la exclusión del humano fuera del bucle OODA (Observar, Orientar, Decidir y Actuar) como una norma aplicada de forma general. Es decir, podríamos pasar de esto:
- Sensor → Analista humano → Cadena de mando → Decisión → Actuación
A esto:
- Sensor → Algoritmo de decisión → Actuación
Evidentemente, el factor humano actúa como un cuello de botella, pero es imprescindible para evitar posibles desastres o actuaciones erráticas con consecuencias imprevisibles. Corremos el riesgo real de que los gobiernos deleguen las decisiones en la IA con el mero afán de ser más rápidos que el enemigo.
Desconfianza, factor económico y control de la información
La desconfianza entre las dos potenciales mundiales en IA, Estados Unidos y China, podría dificultar enormemente un entendimiento a la hora de poner reglas claras sobre cómo se usa la IA. China teme quedarse atrás y desconfía de las peticiones occidentales. Y lo mismo puede decirse de Estados Unidos. Asimismo, el secretismo hará inviable que Washington y Pekín realmente verifiquen si se han aplicado pausas reales en el desarrollo de esta tecnología.
Finalmente, a corto plazo podría ver un aterrizaje forzoso en plano económico. Existe una necesidad imperiosa de abandonar los subsidios masivos de cómputo, subiendo tarifas a las empresas y los usuarios. Nadie en el sector está cobrando lo que realmente necesitan para cubrir los costes y ganar dinero.
En paralelo, el control de la información, que es crucial para los gobiernos, se materializa con la canibalización que el AI Mode y los resúmenes generativos imponen al ecosistema periodístico y a los creadores de datos originales.
El error de temer al monstruo equivocado
La IA no tiene consciencia y, muy probablemente, no la tendrá nunca. Como hemos visto, que Dario Amodei haya lanzado este manifiesto es un movimiento que debe leerse desde múltiples ángulos.
La fantasía de máquinas que cobran vida, sienten rencor y conspiran para destruir a la humanidad no hace más que desviar el debate público de la verdadera urgencia, que es el abismal vacío regulatorio y la ausencia de consenso internacional sobre los límites o guardrails que deben aplicarse.
Ningún gobierno permite que un avión comercial despegue con pasajeros sin miles de horas de certificación técnica y la supervisión de agencias de aviación civil que auditen hasta el último rincón de la nave, ¿verdad? Pues bien, en la frontera de la inteligencia artificial estamos conectando sistemas agénticos con capacidad de hackeo, gestión de infraestructuras o uso militar sin un solo peritaje vinculante, sin certificados y fiándolo todo a la autorregulación de los propios laboratorios.
Las máquinas no van a rebelarse ni a tramar un golpe de Estado por su cuenta. El verdadero peligro es el propio ser humano, dispuesto a ceder la soberanía de sistemas críticos a algoritmos estadísticos no certificados con tal de rascar una décima de segundo en el mercado financiero o en el campo de batalla. Si la IA desencadena una catástrofe en los próximos años, no será fruto del rencor o del odio, sino de nuestra pereza intelectual y de haberle entregado los mandos a un modelo probabilístico sin regulación y sin establecer procesos de seguridad comandados por agencias gubernamentales o consenso internacional.
Fin del Artículo. ¡Cuéntanos algo en los Comentarios!




