Teoría — Decidir juntos sin engañarnos: la ciencia de las trampas colectivas
Atlas sobrevivió dieciséis meses sin que nadie lo defendiera de verdad y sin que nadie lo matara. Ese estado — decisiones que nadie tomaría hoy, sostenidas por mecánica psicológica pura — es el objeto de esta sección: la ciencia de cómo los individuos escalan compromisos, cómo los grupos silencian su propia información, y qué estructuras — no virtudes: estructuras — lo corrigen. Es también la sección donde el curso desmonta un clásico (el groupthink no es lo que te contaron) y arma el kit completo de higiene decisional: premortem, reglas de parada, y las vacunas contra el HiPPO, el superviviente y el cargo cult.
1. Escalada de compromiso: el dinero de ayer no vota, pero grita
El experimento fundacional es de Barry Staw (1976, "Knee-deep in the big muddy"): en una simulación de decisiones de inversión, quienes eran personalmente responsables de una decisión previa con malos resultados asignaron después significativamente más recursos a esa misma línea de acción que quienes heredaban la decisión de otro. El mecanismo: autojustificación — reforzar la apuesta es defender retrospectivamente el propio juicio. (El título alude a una canción de protesta sobre Vietnam: la escalada como fenómeno nacional.)
El pariente célebre es la falacia del coste hundido (Arkes y Blumer, 1985, diez experimentos): la tendencia a continuar un empeño por lo ya invertido — dinero, esfuerzo, tiempo — aunque lo invertido sea irrecuperable y, por tanto, racionalmente irrelevante. Sus demostraciones clásicas: los abonados de teatro que pagaron precio completo asistieron más funciones que los que recibieron descuento sorpresa (mismo teatro, mismas obras); y el «avión ciego al radar»: el 85% de los sujetos continúa un proyecto de I+D condenado si ya está invertido al 90%, frente a una minoría cuando el mismo caso se plantea como inversión nueva. La frase de Aurelia — «con todo lo que llevamos invertido…» — es este experimento recitado de memoria. El meta-análisis de Sleesman et al. (2012) confirma los determinantes: responsabilidad personal y costes hundidos encabezan la lista. Estado: sólido (con la nota honesta de que algunas viñetas clásicas individuales han mostrado fiabilidad baja en réplicas; el efecto agregado sobrevive).
Y lo más valioso: los antídotos también tienen evidencia:
- Reglas de parada predefinidas (stopping rules): fijar antes de empezar los criterios bajo los cuales el proyecto muere. Boulding, Morgan y Staelin (1997, Journal of Marketing Research) las probaron contra el drenaje de nuevos productos condenados: funcionan — porque trasladan la decisión al momento en que aún no hay ego invertido.
- Desacoplar decisiones (decision decoupling, mismo estudio): que evalúe la continuidad alguien distinto de quien decidió iniciar. No porque el proponente sea tonto: porque es humano, y Staw midió exactamente cuánto.
- Responsabilidad por el proceso, no por el resultado (Simonson y Staw, 1992): cuando la gente sabe que se evaluará cómo decidió (qué información usó, qué alternativas consideró) y no solo cómo salió, la escalada se reduce. En un mundo de ⅓-⅓-⅓ (sección 3), evaluar solo resultados castiga la honestidad y premia la prolongación del zombi.
La maniobra de Víctor con Atlas fue el paquete completo: regla de parada por escrito, evaluación externa al proponente, y un compromiso público que convirtió el archivo del proyecto en cumplimiento de las propias reglas en lugar de en derrota personal. La estructura decide lo que el valor no se atreve.
2. Groupthink: lo que el clásico dice, lo que la evidencia sostiene
Toca el desmontaje prometido. Irving Janis (Victims of Groupthink, 1972) analizó fiascos históricos — Bahía de Cochinos, Pearl Harbor — y propuso el modelo que todo el mundo conoce: grupos cohesionados bajo presión, con líder directivo, desarrollan ilusión de invulnerabilidad, autocensura, «guardianes de la mente»… y deciden desastrosamente. Es de las ideas más enseñadas del management. Y su estado empírico real es este: el modelo completo casi nunca se replica (Fuller y Aldag, 1998, tras 25 años de intentos: los antecedentes y síntomas no aparecen juntos como el modelo predice); y la crítica más elegante (Baron, 2005, "So right it's wrong") da la vuelta al problema: los fenómenos que Janis atribuía a condiciones extremas son en realidad ubicuos — los grupos ordinarios, sin cohesión especial ni crisis, ya convergen, silencian y polarizan. El groupthink no es un fallo raro de grupos especiales: es el estado por defecto de los grupos sin estructura.
Lo que la evidencia sí sostiene con fuerza son tres mecanismos más precisos — y más útiles, porque cada uno tiene contramedida:
Perfiles ocultos (hidden profiles; Stasser y Titus, 1985, muy replicado — meta-análisis de Lu et al., 2012): en experimentos donde la información está repartida (todos saben A; solo uno sabe B, otro C…), los grupos discuten mayoritariamente lo que todos ya saben y fallan en poner en común lo que sabe uno solo — eligiendo opciones inferiores aunque el grupo, colectivamente, tenía los datos para acertar. Duna con su registro de los cuatro usuarios desde febrero es un perfil oculto de manual: la información existía en el sistema; la conversación jamás la habría sacado sola. Contramedidas con base: escritura silenciosa antes de discutir (cada uno vuelca lo suyo antes de que la conversación converja), rondas explícitas, y preguntar activamente por la información única («¿qué sabe cada uno que crea que los demás no saben?»).
Silencio organizacional (Morrison y Milliken, 2000) y teorías implícitas de la voz (Detert y Edmondson, 2011): el callar no es un rasgo tímido individual sino un clima producido por señales sistémicas — y la gente opera con reglas implícitas aprendidas («no avergüences al jefe en público», «sin datos blindados no hables», «las malas noticias las da otro») que funcionan aunque el jefe actual jamás haya castigado a nadie. La frase de Duna — «ofrecerlos parecía una declaración de guerra» — es una teoría implícita de la voz operando. Por eso la respuesta de Víctor («tráelos y ponlos encima de mi mesa; es una orden que me puedes recordar») importa más que cualquier buzón de sugerencias: reescribe la regla implícita con un compromiso explícito y citable.
Polarización de grupo (Moscovici y Zavalloni, 1969; Myers y Lamm, 1976 — muy replicado): la discusión desplaza al grupo hacia una versión más extrema de su inclinación inicial — el comité optimista sale eufórico; el pesimista, apocalíptico. Con corolario práctico: si quieres saber lo que piensa el grupo, recoge los juicios antes de la discusión (revelación simultánea: el planning poker es esto), porque después ya no medirás opiniones — medirás la dinámica.
(Y la paradoja de Abilene — Harvey, 1974: el grupo que hace unánimemente algo que ningún miembro quería, porque cada uno creía que los demás lo deseaban — es una anécdota conceptual útil, no ciencia dura; su fenómeno subyacente, la ignorancia pluralista, sí está investigado. Cítala como parábola.)
3. El premortem: hindsight prospectivo con receta
La herramienta de Sofía tiene autor y mecanismo. Gary Klein ("Performing a Project Premortem", HBR, 2007): al inicio del proyecto, el equipo asume que ya ha fracasado — no «¿qué podría salir mal?» sino «salió mal: escribe la historia de por qué» — cada uno por escrito, en silencio, y luego se comparte. La base experimental es Mitchell, Russo y Pennington (1989): el hindsight prospectivo — imaginar un resultado como cierto y ya ocurrido — aumenta sustancialmente la capacidad de generar razones concretas y específicas (la cifra divulgada «~30% más razones» es la lectura de Klein; en los experimentos, el ingrediente activo es la certeza del resultado imaginado, que desbloquea la memoria episódica: cuentas cómo pasó, no especulas si pasará). Estado: mecanismo con base experimental de laboratorio; la intervención completa en proyectos reales tiene poca evaluación controlada — práctica plausible con mecanismo probado, y así se vende.
Fíjate en que el premortem es un multiherramienta contra todo lo anterior a la vez: legitima la disidencia (el pesimismo pasa de deslealtad a tarea asignada), extrae perfiles ocultos (la escritura individual previa: las migraciones de Paula, los datos de Duna), desactiva la polarización optimista de las planificaciones, y crea el momento natural para fijar las reglas de parada — porque las causas de muerte imaginadas se convierten, con un paso más, en criterios de archivo medibles.
4. Pronosticar: zorros, erizos y la humildad con método
Cuando la decisión depende del futuro («¿despegará este mercado?», «¿aguantará esta arquitectura?»), la referencia es el programa de Philip Tetlock. Expert Political Judgment (2005; 284 expertos, ~28.000 predicciones a lo largo de veinte años): en horizontes largos, la precisión media de los expertos apenas superó el azar — la célebre comparación con el «chimpancé lanzando dardos», que el propio Tetlock lamenta como caricatura: aplica al promedio en el largo plazo, no a toda predicción —; los erizos (una gran teoría que lo explica todo) predijeron peor que los zorros (eclécticos, dubitativos, integradores); y la fama mediática correlacionó con peor puntería. La secuela constructiva (Good Judgment Project, torneos de IARPA 2011-2015; Mellers et al., 2014): existe un ~2% de superforecasters consistentes, y sus rasgos son aprendibles — pensamiento probabilístico granular, descomposición de problemas, y sobre todo actualización incremental frecuente: muchas correcciones pequeñas ante evidencia nueva, sin casarse con la predicción de ayer. (La afirmación popular de que «superaron en ~30% a analistas con información clasificada» procede de reportes secundarios del programa: cítala como tal o no la cites.)
La traducción a producto e ingeniería es directa y ya la practicas si has seguido el curso: registra las predicciones (el preregistro de la sección 3 es esto), da rangos y no puntos (sección 2), re-estima con cada dato nuevo (el re-pronóstico continuo), y desconfía del erizo interno — la gran teoría de la arquitectura/mercado/tecnología que lo explica todo suele predecir peor que el zorro aburrido que dice «depende, midamos».
5. Tres vacunas finales: HiPPO, superviviente, cargo cult
HiPPO — Highest Paid Person's Opinion, la opinión del mejor pagado de la sala. El término lo acuñó el entorno de Ronny Kohavi en Microsoft (2006-2007, con Avinash Kaushik) precisamente porque tenían los datos que lo desautorizaban: si solo ⅓ de las ideas de los expertos funciona (sección 3), el rango no mejora la puntería — solo el coste de discutirla. La vacuna no es despreciar la experiencia: es degradar al HiPPO de oráculo a generador de hipótesis — su idea entra en la cola de experimentos como las demás, quizá con prioridad, jamás con exención de prueba.
Sesgo del superviviente. La historia real está documentada (Mangel y Samaniego, 1984, analizando los memoranda originales): Abraham Wald, en el Statistical Research Group de Columbia durante la Segunda Guerra Mundial, desarrolló el aparato matemático para estimar la vulnerabilidad de los bombarderos corrigiendo el sesgo de muestreo — los aviones que volvían mostraban impactos en las zonas no críticas; los alcanzados en las críticas no volvían a ser contados. (La escena cinematográfica de Wald soltando «blindad donde no hay agujeros» es dramatización posterior; el razonamiento es auténtico.) Aplicación de cada día: «copiemos el modelo Spotify/Lantana/Google» estudia solo a los aviones que volvieron — sin ver el cementerio de organizaciones que hicieron lo mismo y cayeron. Con el agravante documentado en el caso más famoso: el «modelo Spotify» de las squads y tribus fue desmentido como descripción de la realidad interna por los propios autores del whitepaper y ex-empleados — medio sector copió durante una década el plano de un avión que ni siquiera existió como volaba en el póster.
Cargo cult. El nombre viene del discurso de graduación de Richard Feynman en Caltech (1974, "Cargo Cult Science", texto íntegro en abierto): los isleños del Pacífico que tras la guerra construían pistas, torres y cascos de madera esperando que los aviones de suministros volvieran —
"They're doing everything right. The form is perfect. […] But it doesn't work. No airplanes land." [traducción propia] «Lo hacen todo bien. La forma es perfecta. […] Pero no funciona. No aterriza ningún avión.»
— y su principio, que este curso suscribe como lema: "The first principle is that you must not fool yourself — and you are the easiest person to fool" («el primer principio es no engañarte a ti mismo — y tú eres la persona más fácil de engañar»). Steve McConnell lo aplicó al software ("Cargo Cult Software Engineering", IEEE Software, 2000): organizaciones que imitan los rituales visibles de otras — o del método de moda — sin los mecanismos que los hacían funcionar. La daily sin transparencia real, la retro sin seguridad psicológica, el «modelo del Petirrojo» empaquetado por una consultora: pistas de bambú, perfectamente construidas. La advertencia de M. en el prólogo del Cuaderno es la contramedida en una línea: no copies la práctica; entiende el mecanismo, y construye lo tuyo. Que es, dicho sea, la tesis pedagógica de este curso entero.
Para llevar
- La escalada de compromiso es robusta y tiene dirección conocida: quien decidió, refuerza (Staw); lo invertido es irrecuperable y por tanto irrelevante para la decisión — pero grita (Arkes y Blumer). Antídotos con evidencia: reglas de parada escritas antes, evaluador distinto del proponente, y responsabilidad por el proceso, no solo por el resultado.
- El groupthink clásico tiene soporte débil; lo que está sólidamente establecido es peor: los grupos por defecto discuten lo que todos saben (perfiles ocultos), callan por reglas implícitas (silencio organizacional) y se extreman al discutir (polarización). Las contramedidas son estructura barata: escritura en silencio, rondas, revelación simultánea, preguntar por la información única.
- El premortem (Klein) convierte el pesimismo en tarea: «ya fracasó: cuenta por qué» genera razones más concretas que «¿qué podría fallar?» (hindsight prospectivo), extrae perfiles ocultos y desemboca naturalmente en reglas de parada.
- Los expertos promedio predicen poco mejor que el azar a largo plazo; los que aciertan (zorros, superforecasters) descomponen, dan rangos y actualizan incrementalmente — hábitos aprendibles que ya practicas si preregistras, das percentiles y re-pronosticas.
- HiPPO: el rango no mejora la puntería (⅓ de aciertos también en despachos); degrada la opinión cara a hipótesis con prioridad, no a veredicto. Superviviente: antes de copiar un modelo de éxito, pregunta por el cementerio — y recuerda que el «modelo Spotify» ni siquiera describía a Spotify. Cargo cult: la forma perfecta no aterriza aviones; copia mecanismos, no rituales.
Para profundizar
- Staw, B. (1976). "Knee-deep in the big muddy" — PDF: https://strategy.sjsu.edu/www.stable/B290/reading/Staw,%20B%20M,%201976,%20Organizational%20Behavior%20and%20Human%20Performance.%2016%20pp%2027-44.pdf
- Baron, R. (2005). "So right it's wrong" — PDF: https://www.paci.com.au/downloads_public/risk/10_Paper_Groupthink.pdf
- Morrison & Milliken (2000). "Organizational Silence" — PDF: https://coalition.agileuprising.com/uploads/default/original/1X/081b55ff7df7ff94f2c92e6c984c730d4c480359.pdf
- Klein, G. (2007). "Performing a Project Premortem" — PDF docente: http://homepages.se.edu/cvonbergen/files/2013/01/Performing-a-Project-Premortem.pdf
- Harvey, J. (1974). "The Abilene Paradox" — PDF docente: https://web.mit.edu/curhan/www/docs/Articles/15341_Readings/Group_Dynamics/Harvey_Abilene_Paradox.pdf
- Mangel & Samaniego (1984), el trabajo real de Wald — PDF: https://jhanley.biostat.mcgill.ca/bios601/CandH-ch0102/WaldAircraft.pdf
- Feynman, R. (1974). "Cargo Cult Science" — texto íntegro: https://calteches.library.caltech.edu/51/2/CargoCult.htm · McConnell, S. (2000). "Cargo Cult Software Engineering": https://stevemcconnell.com/wp-content/uploads/2017/08/CargoCultSoftwareEngineering.pdf
- Kohavi — origen de HiPPO: https://exp-platform.com/hippo/
- Moore & Healy — overconfidence (overprecision incluida): https://learnmoore.org/mooredata/HOC.pdf