ARTÍCULO · Agosto 2026
Cinco casos, una misma lección
Construí un modelo sintético de fintech para estudiar cinco decisiones de Customer Intelligence. El resultado fue consistente: segmentación, churn, next-best-offer, ARPU e incrementalidad cambiaron por definiciones establecidas antes del modelo.
Buena parte del material de Customer Intelligence comienza por el algoritmo: elegir un estimador, ajustarlo y reportar el AUC.
Mi experiencia liderando esta disciplina en telecomunicaciones, medios y fintech me ha enseñado que las decisiones más costosas suelen ocurrir antes: al definir la población, la ventana temporal, la política de contacto o la pregunta causal.
Para poner esa hipótesis a prueba, construí un modelo de datos sintético con estructura causal explícita y desarrollé cinco casos conectados —segmentación, churn, next-best-offer, ARPU e incrementalidad—. Cada caso reutiliza las decisiones y los artefactos de los anteriores, de modo que el conjunto funciona como un sistema y no como cinco ejercicios aislados.
En los cinco, el indicador principal estuvo condicionado por una decisión tomada antes del modelo.
Cinco casos, una misma causa
| Caso | La decisión que cambió el resultado |
|---|---|
| Segmentación | En una suscripción, la recency de RFM tiene un solo valor distinto en 4,376 clientes: a todos se les facturó el mes pasado, porque eso es lo que hace una corrida de facturación. Y la frequency correlaciona 1.0000 con la antigüedad — no está relacionada con ella, es ella. Dos de las tres dimensiones miden el calendario de la empresa, no una decisión del cliente. |
| Churn | El ranking sobrevive el salto temporal; la calibración no. Reordenar las mismas probabilidades por valor esperado en lugar de por riesgo deja dos listas que comparten apenas el 43.9% de los nombres y +1,824 de utilidad con el mismo presupuesto. |
| Next-best-offer | Las compuertas de gobierno no excluyen una muestra aleatoria. El cool-off, tratado con frecuencia como una regla operativa y no de targeting, excluye a 397 clientes; después, ese grupo presenta una tasa de abandono del 24.4%, contra una base de 11.8%: fueron contactados el trimestre pasado por ser de alto riesgo, y quedan vetados este trimestre por haber sido contactados. |
| ARPU | El 98.03% de la varianza de lo que se factura está entre tarifas, no dentro de ellas. El ARPU es la lista de precios. La pregunta estándar —¿los que usan más generan más ingreso?— da +0.30 agregada y −0.02 dentro de cualquier producto. |
| Incrementalidad | Dos campañas de diseño idéntico sobre la misma base reportan +0.02 pp (sin efecto observable) y −8.08 pp (una reducción material y significativa). La clave de respuestas del dataset muestra que la primera sí entregó −4.75 pp y que el azar de la asignación la canceló. Ninguna de las dos podía detectar un efecto menor a ~10 pp. |
En los cinco casos, la complejidad decisiva estaba antes del modelado.
Una base diseñada para hacer visibles las causas
Esta tesis puede ilustrarse con anécdotas, pero demostrarla exige un entorno cuya respuesta causal se conozca de antemano.
Por eso el modelo de datos vino primero, y tiene tres propiedades que los casos necesitan y que un dataset público no da:
- La etiqueta de churn se emite en dos cortes de observación distintos. Eso es lo que permite que un caso entrene en el pasado y puntúe el futuro, en lugar de afirmar que lo hizo.
- La política de contacto es una tabla, no una constante en el script que puntúa. Una política que vive en el código no es una política: es una preferencia, inauditable sin leer Python y distinta en la copia de cada equipo.
- Hay una clave de respuestas — qué habría hecho cada cliente si la campaña nunca se hubiera ejecutado. Existe para verificar estimadores y se mantiene separada del proceso que los construye.
Esa tercera propiedad es la que convierte el caso de incrementalidad en una demostración en vez de una opinión: se puede descomponer la diferencia observada en lo que la campaña entregó más el desequilibrio que introdujo el azar de la asignación, y ver cuál de los dos era más grande.
La disciplina de retirar una conclusión
Escribí una sección entera del caso de ARPU sobre la premisa de que la mora se concentra en los clientes que están por irse. El mecanismo está en el modelo de datos, así que era razonable. Al medirlo, no tiene signo estable: cinco particiones de la misma base van de −0.005 a +0.053.
Retiré esa sección. Hice lo mismo con una afirmación que parecía una regla general —"una constante no puede reordenar un ranking"— y resultó falsa: sí puede hacerlo a través del costo de la oferta. El caso conserva ese resultado como control y la conclusión final es más precisa por ello.
Los cinco reportes documentan también sus restricciones. La evidencia gana valor cuando permite distinguir lo que el sistema demuestra de aquello que todavía no puede sostener.
Alcance y validez de la evidencia
Los datos son sintéticos por diseño: ningún dato de empleador o cliente forma parte del laboratorio. Esa decisión protege la confidencialidad y permite conocer la respuesta causal, pero también acota la validez externa. El proceso generador es conocido y estacionario; por tanto, los casos no reproducen toda la complejidad de una operación real, como historia faltante, cuentas fusionadas, migraciones de producto o facturación demorada.
Dentro de ese alcance, el laboratorio sí ofrece reproducibilidad: dos ejecuciones de cualquier caso producen resultados idénticos byte a byte, y los 128 tests se ejecutan en cada push. Los casos están clasificados como reference: implementaciones de referencia completas y operativas, sin promesa de producto mantenido.
Evidencia reproducible
Todo el track vive en data-intelligence-lab: el generador del modelo de datos, los cinco casos con su pipeline, y un reporte por caso con los números y las limitaciones.
La pregunta relevante no es solo si el modelo fue correcto, sino qué definición condicionó el resultado y qué decisión de negocio se tomó a partir de él.
Ronald Mego
Data & Analytics Executive
Escribo sobre decisiones, sistemas y evidencia en estrategia de datos, Customer Intelligence y Agentic AI.