Teoría — Medir sin romper: la ciencia de las métricas y sus venenos
El IPA de Aurelia vivió cinco semanas y se llevó por delante la honestidad de media empresa. Nada de lo ocurrido era imprevisible: la corrupción de las métricas convertidas en objetivos es uno de los fenómenos mejor documentados de las ciencias sociales, con teoría económica premiada con un Nobel, casos judiciales de tres mil millones de dólares y una genealogía intelectual que merece contarse con precisión — empezando por corregir la cita más famosa del tema, que casi todo el mundo atribuye mal.
1. Goodhart, Campbell, Strathern: la genealogía exacta
La frase que Nadia citó a Víctor — «cuando una medida se convierte en objetivo, deja de ser una buena medida» — se atribuye universalmente a Charles Goodhart, y no la escribió Goodhart. Es de la antropóloga Marilyn Strathern (1997, "'Improving ratings': audit in the British University system", European Review, 5(3), p. 308):
"When a measure becomes a target, it ceases to be a good measure."
(Y Strathern, a su vez, atribuye la etiqueta «ley de Goodhart» a Keith Hoskin.) Lo que Charles Goodhart escribió en 1975, hablando de política monetaria, fue más técnico:
"Any observed statistical regularity will tend to collapse once pressure is placed upon it for control purposes." [traducción propia] «Toda regularidad estadística observada tenderá a colapsar en cuanto se ejerza presión sobre ella con fines de control.»
La versión de las ciencias de la evaluación es la ley de Campbell (Donald T. Campbell, 1979, "Assessing the impact of planned social change", p. 85), anterior a la fama de la de Goodhart y más completa, porque nombra el segundo efecto:
"The more any quantitative social indicator is used for social decision-making, the more subject it will be to corruption pressures and the more apt it will be to distort and corrupt the social processes it is intended to monitor." [traducción propia] «Cuanto más se use un indicador social cuantitativo para tomar decisiones, más sujeto estará a presiones de corrupción y más tenderá a distorsionar y corromper los procesos sociales que pretende monitorizar.»
Fíjate: dos efectos, no uno. La métrica se corrompe (deja de medir lo que medía: los story points inflados ya no predicen nada) y el proceso se distorsiona (el trabajo real se deforma para alimentarla: las rodajas de homeopatía, el refactor cosmético nocturno). El IPA logró ambos en tres semanas.
El mecanismo psicológico fino tiene nombre y experimentos: surrogation (Choi, Hecht y Tayler, 2012, The Accounting Review) — la tendencia de los decisores a tratar la métrica como si fuera el constructo que representa: «entregar los puntos» sustituye mentalmente a «entregar valor», y quien optimiza el número cree sinceramente estar optimizando la cosa. Sus experimentos muestran que la compensación ligada a la métrica exacerba la surrogación, y — dato útil — que el efecto es mayor con una métrica única que con varias. No hace falta cinismo para que Goodhart opere: basta con gente normal bajo incentivos, sustituyendo de buena fe el mapa por el territorio.
Estado de la evidencia: sólido como patrón documentado en dominios múltiples. Y una nota de higiene sobre los ejemplos que circulan: el «efecto cobra» de Delhi (recompensas por cobras → cría de cobras) es probablemente apócrifo — úsese como parábola declarada, no como caso; la fábrica soviética de clavos gigantes es una caricatura de la revista Krokodil (el fenómeno del gaming de planes sí está documentado académicamente, p. ej. Nove, 1977). Los casos duros, con papel oficial detrás, son otros:
- Hanói, 1902: la administración colonial francesa pagó por cola de rata entregada; aparecieron ratas vivas sin cola (soltadas para que criaran) y granjas clandestinas de ratas (documentado por el historiador Michael Vann).
- El NHS inglés, años 2000 (Bevan y Hood, 2006, Public Administration — el estudio de referencia sobre targets and terror): los objetivos de tiempos de espera con castigo a gestores redujeron las esperas reportadas con gaming documentado por la National Audit Office: pacientes retenidos en ambulancias para no arrancar el reloj, reclasificaciones, prioridades clínicas distorsionadas.
- Wells Fargo: cuotas de venta cruzada («Eight is great») → millones de cuentas abiertas sin consentimiento durante años → acuerdo con el Departamento de Justicia de EE. UU. por 3.000 millones de dólares (2020). El caso de campo canónico de Goodhart-Campbell-surrogation, con sentencia.
2. Holmström: la economía formal de por qué pagar por lo medible mata lo demás
La teoría económica del asunto le valió a Bengt Holmström el Nobel de 2016. Su modelo multitarea (Holmström y Milgrom, 1991) formaliza lo que el IPA hizo visible: cuando un agente realiza varias tareas y solo algunas son medibles, ligar la paga a lo medible desvía el esfuerzo desde lo no medible — la calidad, la cooperación, el mantenimiento, la ayuda al de al lado — hacia lo contado. Conclusión formal que suena a herejía y es teorema: en esos casos, el óptimo puede ser incentivos débiles o salario fijo, precisamente para no distorsionar la asignación de esfuerzo (la lecture del Nobel, en abierto, lo cuenta con el ejemplo de pagar a profesores por notas de examen).
Duna es el modelo de Holmström con cara: su trabajo — la verificación cuidadosa, el test incómodo — era la tarea no medible por excelencia, y el IPA la llevó a la última posición porque el índice estaba funcionando exactamente como la teoría predice. Y la aplicación a la velocity merece una declaración de honestidad que ya hicimos en la investigación de este curso y repetimos aquí: no existe literatura revisada por pares específicamente sobre el gaming de la velocity — lo que existe es abundante documentación de practicantes más el respaldo indirecto de toda la teoría anterior, que aplica punto por punto (métrica autoinformada + presión de evaluación = inflación; lo asombroso sería que no pasara). Así se cita: fenómeno de practicantes, mecanismo con Nobel.
3. El episodio McKinsey, o el debate completo en dos newsletters
En agosto de 2023, McKinsey publicó "Yes, you can measure software developer productivity", un framework de métricas individuales y de equipo que corrió por todos los despachos (incluido, meses después, el del board de Aurelia). La respuesta de Kent Beck y Gergely Orosz — publicada simultáneamente en sus newsletters, en abierto, y convertida ya en referencia — es una clase magistral de todo este capítulo. Su modelo:
Esfuerzo → Output → Outcome → Impacto. El esfuerzo (horas, actividad) y el output (commits, PRs, features) son lo barato de medir y lo fácil de falsear; el outcome (comportamientos de usuario que cambian) y el impacto (resultados de negocio) son lo que importa y lo caro de medir. El framework de McKinsey, argumentan, mide sistemáticamente las dos casillas de la izquierda — y por Goodhart-Campbell-Holmström, medir con consecuencias las casillas de la izquierda empeora las de la derecha. Con la regla complementaria de Beck: mide para informar al equipo, no para evaluar individuos — porque el mismo número cambia de naturaleza (y de fiabilidad) según quién lo mira con qué poder. Martin Fowler había escrito la versión corta veinte años antes ("CannotMeasureProductivity", 2003): no podemos medir la productividad porque no podemos medir el output que importa — el valor de negocio entregado — y toda proxy invita a su propio gaming.
4. La evaluación de personas: el ruido está en el evaluador
¿Y las evaluaciones de desempeño clásicas — el rating anual, la curva forzada? Aquí la evidencia es devastadora y casi desconocida. Scullen, Mount y Goff (2000, Journal of Applied Psychology), con dos muestras grandes (2.350 y 2.142 managers evaluados por jefes, pares y subordinados), descompusieron estadísticamente la varianza de los ratings de desempeño:
El efecto idiosincrático del evaluador explicó el 62% y el 53% de la varianza; el desempeño real del evaluado, en torno al 21-25%.
Léelo otra vez: más de la mitad de tu rating no habla de ti — habla de quién te puntúa (su dureza, sus sesgos, su humor, su teoría implícita del talento). El desempeño real pesa menos de la mitad que el ruido del juez. (Replicado: Hoffman, Lance et al., 2010 — "rater source effects are alive and well".) Sobre el stack ranking (distribución forzada del estilo «un 10% debe suspender»): la evidencia documentada apunta a deterioro de colaboración, aversión al riesgo y percepción de injusticia bajo interdependencia alta — el caso Microsoft, que lo abandonó en 2013 tras concluir internamente que fomentaba competencia tóxica, es el ejemplo canónico (caso, no experimento). Si el rating individual es mitad ruido, rankear personas con decimales es rankear ruido con ceremonia.
Esto da contexto científico a la posición más famosa y polémica de W. Edwards Deming, que en sus 14 puntos (Out of the Crisis, 1986) pedía literalmente: eliminar las cuotas numéricas y la gestión por objetivos (punto 11), y abolir la calificación anual por méritos (punto 12) — porque roban a la gente «su derecho a estar orgullosa de su trabajo» y confunden a la persona con las variaciones del sistema en el que trabaja. Durante décadas sonó a extremismo de gurú; Scullen, Holmström y el IPA sugieren que era, sobre todo, alguien que entendía la variación.
5. La tensión fértil: Deming contra Locke y Latham (y qué hacer con los OKRs)
Y aquí el curso te debe una tensión sin resolver, porque es real y es fértil. La sección 2 y esta parecen decir «los objetivos numéricos corrompen» — pero la teoría de fijación de metas de Locke y Latham (2002, síntesis de 35 años y ~400 estudios) es una de las más sólidas de la psicología organizacional: las metas específicas y difíciles producen mayor rendimiento que «hazlo lo mejor que puedas», vía atención, energía, persistencia y estrategia — con moderadores conocidos: compromiso con la meta, feedback de progreso, y complejidad de la tarea (en tareas complejas/nuevas, las metas de resultado difíciles pueden empeorar el rendimiento; funcionan mejor metas de aprendizaje). ¿Cómo casan ambos cuerpos de evidencia? Con la letra pequeña de cada uno — y la propia literatura de metas la aporta: "Goals Gone Wild" (Ordóñez, Schweitzer, Galinsky y Bazerman, 2009) documenta los efectos secundarios sistemáticos — estrechamiento del foco, más conducta no ética para «llegar», erosión de la motivación intrínseca — y propone tratar las metas «como un medicamento con receta: dosis y efectos adversos». La síntesis operativa:
- Metas específicas, elegidas o co-elegidas por quien las ejecuta (compromiso), con feedback frecuente: funcionan. Un sprint goal es esto.
- Metas numéricas impuestas, ligadas a evaluación o paga, sobre métricas manipulables: Goodhart, Campbell, Holmström y Wells Fargo. Una cuota es esto.
- En trabajo exploratorio (dominio complejo, sección 2): metas de aprendizaje («valida/descarta estas dos hipótesis»), no de resultado («consigue +20% de conversión») — porque el resultado no está bajo control de nadie y la meta solo puede cumplirse falseándola.
Con esto, los OKRs quedan donde deben: el linaje histórico es Drucker (MBO) → Andy Grove en Intel → John Doerr los lleva a Google en 1999; la evidencia causal directa sobre el framework OKR como tal es, honestamente, casi nula (casos corporativos y material de vendedores; nada experimental) — su base científica es prestada de la teoría de metas, y por tanto hereda sus condiciones: funcionan como herramienta de foco y alineación si son pocos, de equipo, aspiracionales y — la condición que Google siempre subrayó y casi todo adoptante ignora — desacoplados de la compensación y la evaluación (Google puntuaba 0,6-0,7 como zona óptima: un OKR que se cumple al 100% era una meta cobarde, cosa imposible de sostener si del OKR depende el bonus). Los OKRs en cascada rígida que convierten cada equipo en ejecutor de la aritmética de arriba son MBO con marca nueva — exactamente lo que Deming enterró con argumentos que ahora tienen meta-análisis.
6. Medir sana(mente): el diseño que resiste a Goodhart
¿Entonces no se mide? Al contrario: se mide más y mejor — pero con arquitectura defensiva. Los principios, todos ya en la propuesta que cruzó al board:
- Mide el sistema, no a las personas. Las métricas de flujo y calidad describen el sistema de trabajo (secciones 5 y 7: el rendimiento es mayormente propiedad del sistema); úsalas para que el equipo aprenda, y estarás en el caso de uso que no las corrompe. La regla de Beck como política escrita.
- Nunca una métrica sola: pares y guardarraíles. La respuesta ingenieril directa a Goodhart, formalizada por la práctica de experimentación (Kohavi: el Overall Evaluation Criterion se define antes, y viaja siempre con guardrail metrics — las que no pueden empeorar). Velocidad de entrega con tasa de fallo de cambios; throughput con churn de código; tickets cerrados con reaperturas. Todo lo que se optimiza necesita un testigo de lo que se sacrifica. (Y recuerda a Choi: varias métricas reducen la surrogación; una sola la dispara.)
- El estándar de la industria existe y es este: las cuatro métricas DORA — frecuencia de despliegue y lead time (throughput), tasa de fallo de cambios y tiempo de restauración (estabilidad) — cuya virtud estructural es venir en pareja tensionada: no puedes lucir velocidad sin que la estabilidad te delate. El hallazgo replicado año tras año del programa DORA: velocidad y estabilidad no son un trade-off — los equipos buenos mejoran ambas (lo veremos con sus limitaciones metodológicas en la sección 11). Y SPACE (Forsgren, Storey et al., 2021, ACM Queue) como marco anti-reduccionista: la productividad tiene cinco dimensiones (Satisfacción, Performance, Actividad, Comunicación, Eficiencia) y ninguna métrica única puede capturarla — cita el paper la próxima vez que alguien proponga un índice con dos decimales.
- Outcomes por encima de output, siempre. La única casilla que Goodhart no puede falsear del todo es la de la derecha: Ondara renueva o no renueva; las gobernantas usan o no usan. Cuanto más arriba en la cadena esfuerzo→impacto ancles tus objetivos, menos gaming cabe — a costa de más latencia y más ruido, que se gestionan con las métricas de flujo como leading indicators (señales tempranas) sin convertirlas jamás en el objetivo.
- Las métricas caducan: audítalas. Strathern otra vez: toda medida bajo presión degenera. La contramedida es revisar periódicamente el propio panel — ¿qué está incentivando de verdad este número? ¿qué ha dejado de medir? — es decir, aplicar el doble bucle de la sección 6 también a la instrumentación. El Becario Fantasma es, en el fondo, una herramienta de auditoría: si un agente sin instrucciones útiles puede maximizar tu métrica, tu métrica no mide utilidad. Úsalo como test mental permanente — cada vez más literal, por cierto, en un mundo donde parte del trabajo lo hacen agentes que optimizan lo que se les pide con celo perfectamente goodhartiano.
Para llevar
- «Cuando una medida se convierte en objetivo, deja de ser buena medida» es de Strathern (1997), popularizando a Goodhart (1975); la ley de Campbell (1979) añade el segundo efecto: además de corromperse la métrica, se distorsiona el proceso medido. El mecanismo psicológico es la surrogación: confundir de buena fe el mapa con el territorio.
- Casos con papel oficial: Hanói 1902, NHS (targets and terror), Wells Fargo (3.000M$). El efecto cobra es parábola, no caso — cítalo como tal.
- Holmström (Nobel 2016): pagar por lo medible desvía el esfuerzo de lo no medible (calidad, cooperación, verificación); a veces el óptimo es no ligar paga a métricas. Duna última en el ranking es el teorema con cara.
- Esfuerzo→output→outcome→impacto (Beck y Orosz): los índices individuales miden la izquierda, que es lo falseable; el valor vive a la derecha. Y mide para informar al equipo, no para evaluar individuos.
- Más de la mitad de un rating de desempeño es ruido del evaluador (Scullen: 62%/53%): rankear personas con decimales es rankear ruido. Deming lo pedía abolir por intuición de la variación; la psicometría le dio la razón.
- Las metas específicas funcionan (Locke y Latham) Y los objetivos-cuota corrompen (Goals Gone Wild, Deming): la síntesis es metas co-elegidas con feedback, de aprendizaje en lo exploratorio, y jamás soldadas a paga/evaluación — condiciones que los OKRs heredan y casi nadie respeta.
- Arquitectura anti-Goodhart: medir el sistema, pares y guardarraíles, DORA/SPACE, outcomes arriba, y auditar las métricas mismas. Test del Becario Fantasma: si un agente sin propósito puede maximizar tu métrica, tu métrica no mide propósito.
Para profundizar
- Strathern (1997) — PDF: https://gwern.net/doc/statistics/decision/1997-strathern.pdf · Campbell (1976/1979) — PDF en ERIC: https://files.eric.ed.gov/fulltext/ED303512.pdf
- Choi, Hecht & Tayler (2012), surrogation — SSRN: https://doi.org/10.2139/ssrn.1438212
- Holmström (2016), Nobel lecture "Pay for Performance and Beyond" — PDF: https://www.nobelprize.org/uploads/2018/06/holmstrom-lecture.pdf
- Bevan & Hood (2006) — manuscrito abierto: https://eprints.lse.ac.uk/16211/ · DOJ sobre Wells Fargo: https://www.justice.gov/archives/opa/pr/wells-fargo-agrees-pay-3-billion-resolve-criminal-and-civil-investigations-sales-practices
- Beck & Orosz (2023), respuesta a McKinsey — parte 1: https://newsletter.pragmaticengineer.com/p/measuring-developer-productivity · parte 2: https://newsletter.pragmaticengineer.com/p/measuring-developer-productivity-part-2 · Fowler (2003): https://martinfowler.com/bliki/CannotMeasureProductivity.html
- Scullen, Mount & Goff (2000) — abstract: https://psycnet.apa.org/record/2000-16936-012
- Ordóñez et al. (2009), "Goals Gone Wild" — PDF: https://www.hbs.edu/ris/Publication%20Files/09-083.pdf · Locke & Latham (2002) — PDF: https://med.stanford.edu/content/dam/sm/s-spire/documents/PD.locke-and-latham-retrospective_Paper.pdf
- re:Work, guía de OKRs (el 0,6-0,7 y el desacople de compensación): https://rework.withgoogle.com/en/guides/set-goals-with-okrs
- SPACE (Forsgren et al., 2021) — ACM Queue, abierto: https://queue.acm.org/detail.cfm?id=3454124 · DORA: https://dora.dev/