Teoría — La era de la IA: la evidencia, sus contradicciones y una extrapolación honesta
Esta es la sección para la que el curso entero ha estado entrenando. Todo lo aprendido — leer evidencia, distinguir percepción de medición, pensar en sistemas y bucles — se aplica ahora al terreno más ruidoso, más comercialmente contaminado y más importante de la década: qué hace realmente la IA con el desarrollo de software. La primera mitad del capítulo es empírica: los estudios 2023-2026, con sus contradicciones explicadas. La segunda es extrapolación — y va marcada como tal, porque la honestidad epistémica no se suspende justo cuando más se necesita.
1. ¿Hace más rápido a la gente? Depende — y el «depende» está medido
Los cuatro estudios que hay que conocer, en orden de aparición:
- Peng et al. (2023, GitHub/Microsoft/MIT): experimento controlado, 95 programadores, una tarea — implementar un servidor HTTP en JavaScript desde cero. Con Copilot: 55,8% más rápidos. El escenario: greenfield, bien especificado, sin codebase previa ni revisión. El titular de la década salió de aquí.
- Cui et al. (2025, Management Science): tres RCTs de campo en Microsoft, Accenture y una Fortune 100 — 4.867 desarrolladores: +26% de tareas completadas de media, con los juniors adoptando más y ganando más. Paradis et al. (Google, 2024): RCT interno, ~21% menos tiempo en una tarea enterprise.
- Y el jarro de agua fría metodológicamente más interesante del periodo: el RCT de METR (2025). Dieciséis desarrolladores de élite, 246 tareas reales en sus propios repositorios open source — proyectos que conocían íntimamente —, cada tarea aleatorizada a con/sin IA. Resultado: con IA fueron un 19% más lentos. Y la joya: antes del estudio predijeron que la IA los aceleraría un 24%; después de terminarlo, estimaron que los había acelerado un 20%. La medición dijo lo contrario de la percepción — incluso en retrospectiva.
- Actualización obligada (honestidad ante todo): en febrero de 2026, METR publicó que su experimento de seguimiento sufrió sesgos de selección serios (participantes evitando someter al experimento las tareas donde esperaban más ganancia) y que sus resultados nuevos ya no muestran ralentización clara — advirtiendo que probablemente subestiman la ganancia real. El −19% es un hallazgo real, fechado y condicionado, que su propio autor ha matizado. Así se cita.
¿Contradicción entre +56% y −19%? No: contexto, y la tabla de reconciliación es la lección:
| Favorece a la IA | Desfavorece |
|---|---|
| Tarea nueva, aislada, bien especificada | Codebase madura con requisitos tácitos |
| Poca familiaridad previa con el dominio | Experto en SU propio repositorio |
| Métrica: velocidad de la tarea | Métrica: tiempo total con revisión y retrabajo |
| Verificar es barato | Verificar es caro |
La última fila es la síntesis de todo: la IA acelera donde verificar es barato y se atasca donde verificar es caro — que es exactamente lo que la teoría de bucles (sección 6) y de colas (sección 7) predecían. Y el hallazgo transversal más robusto del periodo no es ninguna cifra de productividad sino la brecha percepción-realidad: la gente siente aceleración con independencia de lo que mide el cronómetro (Ziegler et al., CACM 2024, encontraron que la tasa de aceptación de sugerencias predice la productividad percibida — la variable que METR demostró poco fiable). Toda decisión de adopción basada en encuestas de satisfacción está construida sobre esa arena.
2. DORA 2023-2025: la IA como amplificador
La serie temporal del programa DORA (encuestas masivas anuales; correlacional, con la etiqueta de siempre) cuenta una historia coherente en tres actos. 2023: la mitad del sector ya usaba IA; impacto medido en el rendimiento de equipo, marginal. 2024, el hallazgo incómodo: más adopción de IA se asociaba con peor estabilidad de entrega (−7,2%) y ligeramente peor throughput (−1,5%) — mientras el 75% reportaba ganancias de productividad. Interpretación de DORA: lotes de cambio más grandes y confianza excesiva, sin reforzar los amortiguadores clásicos (tests, integración, lotes pequeños). 2025 (~5.000 profesionales, 90% de adopción, mediana de ~2 horas/día con IA): el throughput ya correlaciona en positivo, la inestabilidad persiste, y la tesis del informe quedó en una frase que ya has leído en boca de Maia: «AI acts as an amplifier» — la IA amplifica los sistemas sociotécnicos buenos y magnifica el caos de los malos, y los cuellos de botella se desplazan aguas abajo: testing, code review, QA.
Compárese con la quincena de Albor: Aurelia fue el informe DORA 2024 en miniatura — velocidad local comprada con estabilidad — y su recuperación, el de 2025: los fundamentos primero, la IA después, enganchada a los bucles.
3. La frontera dentada: donde la IA te hace peor
El experimento de campo más citado del periodo merece su fama. Dell'Acqua et al. (2023, Harvard/BCG): 758 consultores de BCG, tareas reales, con y sin GPT-4. En tareas dentro de la frontera de capacidad de la IA: +12,2% de tareas completadas, 25% más rápido, ~40% más calidad — con efecto nivelador (los de menor rendimiento previo ganaron más). En una tarea diseñada para estar fuera de la frontera — donde la IA producía una respuesta convincente y equivocada —: los consultores CON IA acertaron 19 puntos porcentuales menos que los que trabajaron sin ella. La IA no solo no ayudó: empeoró al experto, porque la fluidez de la respuesta desactivó su vigilancia.
De ahí el concepto que da título al paper — la frontera dentada (jagged frontier): la capacidad de la IA no es un nivel uniforme sino una costa recortada, con bahías de competencia sobrehumana junto a acantilados de incompetencia convincente, y sin señalización. Los patrones de uso eficaz que el estudio identificó: centauro (dividir estratégicamente: esto lo hago yo, esto la máquina) y cyborg (integración fina, cruzando la frontera continuamente con verificación). El riesgo profesional de la década no es usar IA ni dejar de usarla: es no saber dónde está la frontera en tu dominio — y la frontera se mueve con cada versión, así que mapearla es tarea continua, no conocimiento adquirido. (Recuérdese la memoria transactiva de la sección 5: el equipo calibra al agente como calibra a un compañero — qué sabe, cuándo alucina — y esa calibración es mantenimiento, no configuración.)
4. Calidad y seguridad: lo que dicen los repositorios
Si la sección 10 enseñó algo, es que la factura de la velocidad se cobra en producción. Los datos de campo:
- GitClear (serie longitudinal sobre cientos de millones de cambios de código, 2020-2026): el código clonado/copiado pasó del 8,3% al 12,3% de líneas; los bloques duplicados se multiplicaron (×8 en 2024); la actividad de refactorización cayó del ~25% al <10% de las líneas cambiadas (3,8% en el informe de 2026); y el churn temprano — código reescrito a las pocas semanas de nacer — subió del 3,1% al 5,7% y siguió subiendo. Traducción: se añade más, se reutiliza menos, se corrige antes. Cautela declarable: datos observacionales (correlación temporal con la adopción de IA, no causalidad probada) de un vendor con producto que vender — y aun así, la mejor serie pública existente, coherente con la inestabilidad de DORA.
- Perry et al. (Stanford, ACM CCS 2023), experimental: los participantes con asistente de IA escribieron código menos seguro en 4 de 5 tareas — y creyeron con más frecuencia haberlo escrito seguro. La sobreconfianza otra vez, ahora con CVEs. Veracode (2025): los LLMs introdujeron vulnerabilidades del OWASP Top 10 en el 45% de los casos de prueba.
El patrón agregado es exactamente la deuda técnica de la sección 10 en versión acelerada: la generación barata sesga el sistema hacia añadir (duplicar sale «gratis», refactorizar no lo pide nadie), y sin contrapesos — definición de hecho, revisión con criterio, guardarraíles de churn y duplicación en el panel (sección 8) — el interés compuesto corre más que nunca.
5. El aprendizaje y el pozo de los juniors
La parte más seria del cuadro, y la que menos se discute en los comités de adopción:
- Lee et al. (Microsoft Research, CHI 2025), 319 trabajadores del conocimiento: a mayor confianza en la IA, menos pensamiento crítico ejercido; el esfuerzo cognitivo se desplaza hacia verificar e integrar — cuando se ejerce. Gerlich (2025): correlación negativa entre uso intensivo de IA y pensamiento crítico, mediada por descarga cognitiva (cognitive offloading), más fuerte en jóvenes. (Ambos correlacionales y de autoinforme — se dice — pero convergentes con el mecanismo de la práctica deliberada de la sección 6: lo que no ejercitas, se atrofia.)
- Prather et al. (ICER 2024), con novatos programando asistidos, observación y eye-tracking: la IA ensancha la brecha — los estudiantes con buena metacognición aceleran; los demás desarrollan una ilusión de progreso (todo compila, nada se entiende) y dependencia. El título del paper es la tesis: The Widening Gap.
- Y el dato de mercado que Teo llevaba en la libreta: Brynjolfsson, Chandar y Chen (Stanford, 2025, "Canaries in the Coal Mine"), con nóminas de millones de trabajadores: el empleo de desarrolladores de 22-25 años cayó ~20% desde finales de 2022, mientras el senior se mantenía o crecía. Las ofertas de desarrollo tocaron fondo un ~36% por debajo de 2020 (Indeed/FRED) antes de repuntar en 2025-26 — sesgadas a seniors.
Junta las piezas y aparece la paradoja del pipeline, que ninguna empresa resuelve sola: los juniors son quienes más productividad ganan con IA (Peng, Cui) y quienes más riesgo corren de no construir el criterio que la supervisión de agentes exige — y encima quienes menos contratos reciben. Una industria que deja de formar juniors está consumiendo su stock de seniors sin reponerlo: el pozo de Maia. Las «horas de banco» de Teo — trabajo deliberadamente sin agente, como inversión explícita en criterio — no son nostalgia artesanal: son la respuesta de diseño al mecanismo documentado por Prather y Lee. Cada organización tendrá que decidir si fabrica sus escaleras o compra seniors mientras queden.
6. Agentes, benchmarks y el arte de no comprarse el humo
Sobre los agentes autónomos — la ola en la que Aurelia montó Prometeo — dos verdades simultáneas. Primera: son reales; el uso masivo está documentado (el Anthropic Economic Index, con datos abiertos, muestra el trabajo de código como la categoría dominante de uso real, y en herramientas agénticas la delegación — el humano valida al final — supera con mucho a la colaboración paso a paso). Segunda: la evidencia de benchmark que los promociona está parcialmente quemada. El estándar de facto, SWE-bench, acumuló críticas devastadoras con datos: ~33% de los parches «exitosos» tenían la solución filtrada en el propio enunciado, otro tanto pasaba por tests inadecuados, y hay evidencia de memorización del training set — hasta el punto de que OpenAI anunció en 2026 que dejaba de reportar el benchmark por contaminación. Y la evaluación independiente más citada de un agente comercial célebre (Devin, por Answer.AI): 3 éxitos en 20 tareas reales.
La regla de higiene que se deriva es la del curso entero aplicada al marketing de IA: un benchmark es una cifra zombi en potencia — pregunta qué mide, con qué filtraciones, y sobre todo: evalúa los agentes contra tu propio backlog y tu propia codebase, con criterios de éxito que incluyan mantenibilidad y no solo «los tests pasan» (el módulo de Bruno pasaba los tests). En cuanto al vibe coding (Karpathy, 2025: entregarse a la generación sin mirar el código), su propio autor lo acuñó para prototipos desechables de fin de semana — el uso que su nombre honesto indica — y la industria lo aplicó a producción, porque la industria hace esas cosas.
7. ¿Y el empleo? Jevons, con cautela
La predicción «no habrá programadores en dos años» (circa 2023-24) ha vencido y no se ha cumplido: lo observado a 2026 es recomposición — menos entrada junior, más demanda de criterio senior, repunte de ofertas con la IA dentro de la descripción del puesto. El argumento económico optimista tiene nombre viejo: la paradoja de Jevons (1865: la eficiencia abarata el recurso y dispara su consumo total) — si el software a medida se vuelve barato, se demandará muchísimo más software, y con él más criterio humano para dirigirlo y verificarlo. Es la apuesta explícita de buena parte de la industria (Nadella la tuiteó con cita de Jevons incluida). Estado honesto: hipótesis económica plausible con evidencia parcial, no ley — y nótese que incluso si se cumple para el software, no garantiza que se cumpla para el empleo de desarrolladores humanos en su forma actual. Lo que sí está claro es qué perfil compra el mercado en la transición: el que esta sección lleva describiendo — criterio, verificación, producto.
8. El desplazamiento del cuello de botella: la tesis del curso, con sus fuentes
Y así, todas las líneas convergen en la tesis que da título a este curso. Kent Beck, abril de 2023, semanas después de probar los primeros asistentes serios: «el valor del 90% de mis habilidades acaba de caer a cero dólares. El apalancamiento del 10% restante se ha multiplicado por mil» — el 10%: diseño, juicio, decidir qué construir. Martin Fowler, 2026: "Code generation is no longer the bottleneck — verification is. […] The game is not 'how fast can we build' any more. It is 'how fast can we tell whether this is right'" — «generar código ya no es el cuello de botella: lo es la verificación. El juego ya no es "cuán rápido construimos" sino "cuán rápido sabemos si esto está bien"» [traducción propia]. Los datos de campo lo respaldan por todos los flancos: la frustración nº1 de los ~49.000 encuestados de Stack Overflow 2025 es lidiar con «soluciones de IA casi correctas» (66%); Atlassian 2025 encuentra que el 99% ahorra tiempo con IA y la mitad lo pierde otra vez en fricción organizativa — el ahorro se lo come el sistema, Amdahl saludando (sección 7).
Formulado con el vocabulario del curso: la IA ha reducido drásticamente el coste de una fase — la generación — de un sistema cuyo rendimiento está limitado por sus otras fases (Amdahl) y gobernado por sus colas (Little, Kingman) y sus bucles (cibernética). El resultado necesario es el que estás viendo: la restricción se ha desplazado a la verificación y a la decisión — a saber si está bien y a saber si debía existir. Que son, respectivamente, la ingeniería de siempre en su parte difícil, y el producto de la sección 3.
9. Extrapolación (y se dice: esto es especulación fundamentada)
Lo que sigue no son datos: son proyecciones derivadas de los principios del curso, del tipo que la sección 2 enseñó a hacer — con vista externa y sin fecha-punto. Cada una lleva su fundamento entre paréntesis, para que puedas auditar el razonamiento y descartarla cuando la evidencia diga otra cosa:
- Las prácticas de verificación se convertirán en la infraestructura crítica del oficio. Tests como especificación ejecutable, entornos de staging serios, revisión con contexto (el dueño-de-historia de Aurelia), telemetría de outcome — todo lo que abarata «saber si está bien» pasa de higiene a ventaja competitiva. (Fundamento: la restricción manda — Goldratt; DORA 2024-25; Fowler.)
- Los lotes pequeños importarán más que nunca, contra la intuición. La tentación del agente es el PR de tres mil líneas; la capacidad de verificación humana obliga a lo contrario — cambios pequeños, verificables, con dueño. Quien subordine la generación a la verificación ganará a quien haga lo inverso. (Little, Kingman, Reinertsen; el experimento del Petirrojo.)
- El diseño motivacional del trabajo humano-IA será una competencia gerencial de primer orden. Los flujos que dejan a las personas las junturas (aprobar, rellenar, vigilar) desmotivarán y degradarán el criterio de forma predecible; los que asignan piezas completas del sistema conjunto — con agentes dentro del flujo humano — retendrán talento y calidad. (JCM, SDT, ownership — sección 4; el «aprobador profesional».)
- Las organizaciones que midan output de IA repetirán el IPA a escala. Líneas generadas, PRs de agente, «% de código escrito por IA» como KPI: todo el capítulo 8 aplica sin cambiar una coma, con agentes optimizando la métrica con celo goodhartiano literal. Las que sobrevivan medirán outcomes y guardarraíles. (Goodhart-Campbell-Holmström; reward hacking.)
- El pipeline de juniors se convertirá en decisión estratégica explícita. Escaleras fabricadas a propósito (horas de banco, pairing con y sin agente, revisión como docencia) o compra de seniors a precios crecientes hasta que el pozo se seque. Las empresas que hoy parecen «ineficientes» por formar gente serán las que tengan criterio en plantilla en 2030. (Prather, Lee, Brynjolfsson; práctica deliberada.)
- La ventaja durable será organizativa, no tecnológica. Los modelos se alquilan por igual; los bucles cortos, la seguridad psicológica, la cultura generativa y el gobierno del común propio no. «La IA amplifica lo que ya eres» implica que la inversión con mejor retorno de la era de la IA es, paradójicamente, todo lo que este curso contó antes de llegar a la IA. (DORA 2025; Dell'Acqua; todo lo anterior.)
- Y el oficio se recentrará en lo que hemos llamado ingeniería de producto: responder del producto entero — problema, hipótesis, construcción dirigida, verificación, operación, outcome — con los agentes dentro del flujo como antes estuvieron el compilador y el framework. No es la muerte del ingeniero: es la enésima subida en la escalera de abstracción, con la diferencia de que esta vez lo que queda abajo no es sintaxis sino certeza — y administrar incertidumbre con método es, precisamente, todo lo que este curso ha enseñado. (Beck; la historia entera de Nadia.)
Podemos equivocarnos en las siete. La manera de saberlo es la de siempre: criterios de éxito por delante, datos por encima de relatos, y revisión sin piedad cuando la realidad conteste — porque a la naturaleza, como dejó escrito Feynman, no se la puede engañar.
Para llevar
- La evidencia de productividad no es contradictoria sino contextual: enormes ganancias en tarea nueva y verificable (Peng +56%, Cui +26%), pérdidas o nada en sistemas vivos con expertos (METR −19%, luego matizado por su propio autor). La regla: la IA acelera donde verificar es barato.
- El hallazgo más robusto del periodo es la brecha percepción-realidad: sentirse más rápido no es serlo, ni siquiera en retrospectiva. Mide con datos de flujo y outcome, jamás con encuestas de satisfacción solas.
- La IA es un amplificador (DORA): mejora a los sistemas sociotécnicos buenos y magnifica el caos de los malos; la factura llega por estabilidad, duplicación, churn y seguridad (GitClear, Perry, Veracode) si no hay contrapesos.
- La frontera es dentada y sin señalizar (Dell'Acqua): dentro, te mejora; fuera, te empeora más que no usarla, porque desactiva tu vigilancia. Mapearla en tu dominio es mantenimiento continuo.
- El pipeline de juniors es el problema sistémico silencioso: los que más ganan con IA son los que más riesgo corren de no construir criterio — y los que menos contratos reciben. Las escaleras (trabajo sin agente, revisión como docencia) hay que fabricarlas a propósito.
- Los benchmarks de agentes están parcialmente quemados (SWE-bench): evalúa contra tu backlog, con mantenibilidad en el criterio. Y el cuello de botella se ha desplazado oficialmente: de generar a verificar y decidir — invierte ahí, que es donde este curso llevaba apuntando desde la primera página.
Para profundizar
- METR (2025): https://metr.org/blog/2025-07-10-early-2025-ai-experienced-os-dev-study/ · y su actualización de 2026: https://metr.org/blog/2026-02-24-uplift-update/
- Peng et al. (2023): https://arxiv.org/abs/2302.06590 · Cui et al.: https://papers.ssrn.com/sol3/papers.cfm?abstract_id=4945566 · Paradis et al. (Google): https://arxiv.org/abs/2410.12944
- DORA 2025, State of AI-assisted Software Development: https://dora.dev/research/
- Dell'Acqua et al. (2023), jagged frontier: https://papers.ssrn.com/sol3/papers.cfm?abstract_id=4573321
- GitClear, investigación de calidad de código con IA: https://www.gitclear.com/ai_assistant_code_quality_2025_research · Perry et al. (2023): https://arxiv.org/abs/2211.03622
- Lee et al. (CHI 2025): https://www.microsoft.com/en-us/research/publication/the-impact-of-generative-ai-on-critical-thinking-self-reported-reductions-in-cognitive-effort-and-confidence-effects-from-a-survey-of-knowledge-workers/ · Prather et al. (2024): https://arxiv.org/abs/2405.17739 · Brynjolfsson et al., Canaries in the Coal Mine: https://digitaleconomy.stanford.edu/publication/canaries-in-the-coal-mine-six-facts-about-the-recent-employment-effects-of-artificial-intelligence/
- Crítica a SWE-bench: https://arxiv.org/abs/2410.06992 · OpenAI, por qué lo abandona: https://openai.com/index/why-we-no-longer-evaluate-swe-bench-verified/
- Beck, "90% of My Skills Are Now Worth $0": https://newsletter.kentbeck.com/p/90-of-my-skills-are-now-worth-0 · Fowler sobre verificación: https://martinfowler.com/fragments/2026-04-29.html · Stack Overflow Survey 2025: https://survey.stackoverflow.co/2025/ai
- Anthropic Economic Index (datos abiertos): https://www.anthropic.com/research/impact-software-development