Lo que el director financiero ve en el cierre

El cierre de mes llega tarde, y cuando llega trae una línea de transporte que ha crecido sin una causa a la vista. Hubo envíos urgentes para cubrir roturas, camiones que volvieron medio vacíos y un almacén con meses de cobertura en referencias que ya no rotan. Las tres partidas tienen el mismo origen: una previsión de demanda que falló semanas antes, en una hoja de cálculo que alguien actualiza los lunes.

Por eso el sitio donde la IA mueve la cuenta de resultados de una empresa que compra, almacena y distribuye tiene poco que ver con redactar correos. Está en los modelos predictivos que llevan años resolviendo este problema: previsión sobre el histórico de ventas, lectura de la estacionalidad, señales de mercado como promociones, precios o clima, rotación por referencia y optimización del stock y de las rutas. Es una IA sin titulares, y es la que un director financiero puede auditar línea a línea.

¿Cuánto vale, en euros, acertar más? Hay estudios que ponen cifras, y conviene leerlos con el lápiz del auditor antes de llevarlos al consejo.

Qué mide de verdad el estudio que circula

La cifra que aparece en muchas presentaciones comerciales viene de un trabajo publicado en 2025 en el Journal of Business and Entrepreneurship por tres investigadores de la Universidad Técnica Estatal de Quevedo, en Ecuador. Compararon tres modelos de IA (redes recurrentes, Transformer y gradient boosting) con dos métodos estadísticos clásicos, ARIMA y suavizado exponencial, sobre 24 meses de demanda semanal de una cadena de retail latinoamericana, enriquecida con inflación, tipo de cambio, clima, estacionalidad y promociones.

Error de previsión. El Transformer se quedó en un error medio porcentual (MAPE) del 3,9% y el gradient boosting en el 4,5%, frente al 7,2% de ARIMA y el 8,1% del suavizado exponencial. De ahí sale el «hasta un 50% menos de error», que es la distancia entre el mejor modelo y el peor método clásico.

Coste de inventario. Simularon seis meses de gestión de un centro de distribución con las previsiones de cada método. El coste de almacenaje más roturas bajó de 78.100 a unos 53.500 dólares, un 31,5% menos, sobre todo por menos sobrestock, y según su análisis de atribución las variables que más pesaron fueron las promociones y la estacionalidad.

Kilómetros en vacío. Un modelo LSTM aplicado a los datos GPS de una flota, con la demanda y el clima como entradas, redujo los kilómetros en vacío de 1.200 a 1.020, un 15%, y las emisiones bajaron de 4,8 a 4,1 toneladas de CO₂.

Son números razonables y el estudio es útil. También tiene límites que un comité de dirección debe conocer antes de usarlo como argumento.

Cuatro motivos para no llevar el 31,5% al presupuesto

Es una sola empresa y es una simulación. El ahorro de inventario sale de simular seis meses con las previsiones de cada modelo; nadie cambió la reposición de un almacén real durante medio año para comprobarlo. Una simulación bien hecha da el orden de magnitud, mientras que el ahorro realizado solo lo confirma la operación.

La validación puede favorecer a los modelos complejos. Los autores usaron validación cruzada en cinco bloques. En series temporales, si los bloques no respetan el orden cronológico, el modelo entrena con semanas posteriores a las que luego predice y el error medido sale más bajo de lo que será en producción. El artículo no aclara cómo se hicieron las particiones, y esa duda basta para rebajar las expectativas.

El texto tiene incoherencias. Las conclusiones hablan de una reducción del error «de hasta el 50% (45% frente a 38,1%)», una comparación que no casa con ninguna tabla del propio artículo. Los resultados de las tablas siguen en pie, aunque la frase delata una revisión editorial ligera.

El mejor modelo solo se compara con los clásicos. Las pruebas estadísticas confirman que el Transformer supera a ARIMA y al suavizado exponencial, pero no reportan que supere al gradient boosting, que se quedó a seis décimas y es bastante más barato de entrenar, de explicar y de mantener.

Hay además un dato del propio estudio que conviene subrayar: la precisión del modelo explicaba el 68% de la variación del coste. El resto depende de cosas que ningún algoritmo toca por sí solo, como la política de reposición, el tamaño de lote, los plazos reales del proveedor o el contrato de transporte.

"Un modelo que acierta más no ahorra un euro mientras la política de compra siga siendo la misma. El ahorro aparece el día en que alguien firma el cambio en el punto de pedido."

Dónde está el dinero: la IA que no escribe

La conversación sobre IA en los comités lleva tres años ocupada por los modelos generativos, y es comprensible porque son los que se ven. La IA que ataca el coste logístico es anterior y menos vistosa: modelos predictivos entrenados con tu propio histórico, que aprenden cómo se comporta cada familia de producto en cada canal, en qué semanas cambia el patrón y qué señales externas lo anticipan.

Esa IA trabaja sobre cuatro palancas que un director financiero reconoce en su cuenta de resultados.

Estacionalidad y calendario. Campañas, festivos locales, cierres de clientes y el efecto de fin de trimestre en los pedidos B2B. Los métodos clásicos capturan la estacionalidad regular, y los modelos de aprendizaje automático captan además las interacciones, como una promoción que coincide con un puente.

Señales de mercado. Precio propio y de la competencia, promociones, clima e indicadores sectoriales. En el estudio ecuatoriano, promociones y estacionalidad fueron las dos variables con más peso en el ahorro de inventario.

Rotación por referencia. Separar las referencias que se pueden prever bien de las que no, porque el stock de seguridad correcto para una referencia errática es muy distinto del de una estable. Aplicar el mismo criterio a todo el catálogo es lo que acaba llenando el almacén de lo que no se vende.

Optimización de stock y de rutas. Con una previsión fiable y su margen de error, el punto de pedido y el stock de seguridad se calculan por referencia en función del nivel de servicio que el comité decida pagar, y la planificación de cargas y rutas se hace sobre la demanda esperada en lugar de sobre la de la semana pasada.

La IA generativa también tiene sitio en este esquema, como interfaz para consultar los datos y entender las cifras. Lo desarrollamos en la sección siguiente.

Cómo se diseña un proyecto que se pueda medir

El patrón que funciona en una empresa mediana que compra, almacena y reparte tiene cinco piezas, y el orden importa más que la tecnología elegida.

Una línea base antes de tocar nada. Error de previsión actual por familia de producto, coste de almacenaje y obsolescencia, capital inmovilizado, roturas con su venta perdida estimada, envíos urgentes y kilómetros en vacío. Si no se mide antes, después no habrá forma honesta de decir cuánto se ahorró.

Un método sencillo como listón. La primera versión del modelo compite contra la misma semana del año anterior o contra un suavizado exponencial, y solo pasa a producción si los bate de forma consistente en semanas que no ha visto. Con frecuencia basta un gradient boosting bien alimentado, que además es más fácil de explicar al equipo de compras que una red neuronal.

La previsión conectada a una decisión. El modelo produce una cifra por referencia y semana con su intervalo de confianza, y esa cifra alimenta el punto de pedido, el stock de seguridad y el plan de cargas. Si el resultado se queda en un cuadro de mando que alguien consulta cuando tiene tiempo, el ahorro depende de la agenda de esa persona.

Un asistente conversacional sobre datos estructurados. Aquí entra el modelo generativo, como capa de consulta: el director de operaciones pregunta por qué subió el coste por pedido en la zona norte en agosto, y el asistente traduce la pregunta a una consulta sobre el almacén de datos, devuelve la cifra y enseña de dónde sale. La regla de diseño es estricta: los números salen siempre de una consulta, nunca de la redacción del modelo, y las definiciones (qué es un pedido, qué entra en el coste por pedido) están escritas en una capa semántica que el asistente no puede reinterpretar.

Una medición con grupo de control. Algunos almacenes, familias o rutas funcionan con el sistema nuevo y otros siguen con el método actual durante un periodo pactado. La comparación la valida finanzas con las mismas reglas de imputación que usa en el cierre, e incluye el coste de funcionamiento del sistema: plataforma, consumo del modelo generativo, reentrenamientos y las horas del equipo que lo mantiene.

Lo que no suele funcionar a la primera

En estos proyectos los tropiezos se repiten tanto que conviene presupuestarlos desde el principio. Los propios autores del estudio señalan la calidad del dato y la formación técnica como los retos principales, y la práctica lo confirma con bastante detalle.

El histórico registra ventas y esconde la demanda. Cuando una referencia estuvo agotada tres semanas, las ventas de esas semanas fueron cero aunque hubiera clientes esperando, y un modelo entrenado con ese dato aprende a pedir de menos justo donde hubo roturas. Corregir esa demanda censurada es trabajo previo obligatorio.

El maestro de artículos no aguanta el análisis. Referencias que cambiaron de código, unidades de medida mezcladas y productos sustitutos que se canibalizan entre sí hacen que el modelo mezcle historias que no tienen nada que ver hasta que alguien las ordena.

Las promociones no están registradas. Si el calendario comercial vive en correos y presentaciones, la variable que más pesó en el estudio no existe para el modelo, y reconstruirla hacia atrás lleva semanas.

La previsión mejora y el stock no baja. Es el fallo más caro y el más frecuente: el modelo acierta más, pero los planificadores lo corrigen a mano por prudencia y la política de reposición sigue siendo la de siempre. Hace falta pactar cuándo se permite corregir el modelo y registrar cada corrección para medir si mejoró o empeoró el resultado.

Los kilómetros en vacío dependen de contratos. Una previsión mejor permite consolidar cargas, pero el retorno vacío depende también de los acuerdos con los transportistas y de que exista carga de vuelta. Sin renegociarlos, el ahorro en ruta se queda en una fracción del teórico.

Ninguno de estos tropiezos se arregla con un algoritmo mejor, porque todos son de dato y de gobierno. Ahí se va la mayor parte del esfuerzo real, y es la razón por la que el dinero de IA suele ir a la capa equivocada.

Seis preguntas del director financiero antes de firmar

1. ¿Cuál es la línea base y quién la ha firmado? Error actual, coste de inventario, roturas y envíos urgentes, medidos antes del proyecto y aceptados por finanzas. Sin eso, cualquier ahorro posterior será opinable.

2. ¿Contra qué método se compara el modelo? Si la respuesta es «contra lo que hacemos hoy» y lo que se hace hoy es una media móvil en una hoja de cálculo, pide también la comparación con un método estadístico sencillo. Parte de la mejora no necesita IA, y conviene saber cuánta.

3. ¿Cómo se ha validado? La prueba tiene que imitar el uso real, entrenando con el pasado y prediciendo semanas que el modelo no ha visto, en orden cronológico. Cualquier otra validación da cifras más bonitas que las que verás en producción.

4. ¿Qué decisión cambia y quién la firma? Punto de pedido, stock de seguridad o plan de cargas. Si el proyecto no modifica ninguna política con dueño, el ahorro se queda en la presentación.

5. ¿Cuál es el coste completo? Construcción, plataforma, consumo del modelo, reentrenamientos y horas internas, puestos frente al ahorro neto y con su periodo de retorno. Un ahorro del 20% en inventario que exige un equipo dedicado puede no pagar la cuenta en una empresa pequeña.

6. ¿Qué pasa si no funciona? Un umbral de mejora pactado de antemano, un periodo de prueba con grupo de control y el compromiso de apagar el sistema si no lo alcanza. Pactarlo al principio es lo que separa un proyecto de un gasto indefinido.

Cuando estas preguntas tienen respuesta, las cifras de los estudios dejan de ser promesas ajenas y pasan a ser una hipótesis que tu propia operación puede confirmar o desmentir en un trimestre. El caso de negocio para comité y consejo que publicamos este mes detalla cómo presentar ese cálculo.

Lo que un comité puede decidir este trimestre cabe en una frase: elegir una familia de producto o un almacén donde el coste de inventario y de roturas se vea en la cuenta, medir su línea base durante un mes y encargar un modelo que compita contra ella con reglas de medición pactadas con finanzas. Un proyecto así cabe en un trimestre y se puede apagar si no demuestra el ahorro, que es la mejor protección contra los milagros.

Es el trabajo que hacemos en la implementación de IA empresarial: caso de negocio cerrado antes de construir, modelos predictivos donde está el dinero y un asistente conversacional solo donde ayuda a decidir más deprisa. Si el cierre te trae cada mes una línea logística que cuesta explicar, esa es la conversación que merece la pena tener.