← Volver al blog

Modelos ARIMA y SARIMA: el método Box-Jenkins para pronóstico de series de tiempo

Modelos ARIMA y SARIMA: el método Box-Jenkins para pronóstico de series de tiempo

Un modelo ARIMA pronostica una serie a partir de su propio pasado — sin variables externas, solo la estructura que hay en los números mismos: cuánto depende un valor de su historia reciente (autorregresión), cuánta tendencia hay que remover antes de que esa estructura aparezca (diferenciación), y cuánto del ruido se arrastra hacia adelante (media móvil). El método fue formalizado por Box & Jenkins (1970) y sigue siendo, más de 50 años después, uno de los dos baselines estándar para pronóstico univariado — en la competencia M4, los seis métodos de machine learning puro enviados rindieron por debajo del benchmark estadístico Comb en sus 100,000 series, y el método ganador fue un híbrido que combinó suavizamiento exponencial con una red neuronal (Makridakis, Spiliotis & Assimakopoulos, 2020).

Los tres componentes: AR, I, MA

ARIMA(p, d, q) combina:

  • AR(p) — autorregresión: el pronóstico es una combinación lineal de las últimas p observaciones.
  • I(d) — integración: la serie se diferencia d veces para remover la tendencia antes de ajustar.
  • MA(q) — media móvil: el pronóstico también depende de los últimos q errores de pronóstico.

Ajustar el modelo a una serie que no es estacionaria — media y varianza que cambian en el tiempo — hace que los coeficientes AR/MA no sean confiables (FPP3 §9.1); por eso d va primero. Consulta nuestro post sobre estacionariedad y transformaciones para las pruebas y transformaciones que entran en esa elección.

Series estacionales: SARIMA

Retail, e-commerce y la mayoría de las series de demanda tienen un ciclo estacional que un ARIMA simple no puede ver. SARIMA(p,d,q)(P,D,Q)ₘ agrega un segundo conjunto estacional de términos AR/I/MA en el rezago m (12 para datos mensuales, 7 para datos diarios con patrón semanal): un término AR estacional correlaciona el valor con el mismo periodo un año (o semana) atrás, y la diferenciación estacional remueve un patrón que se repite igual que la diferenciación simple remueve una tendencia (FPP3 §9.9).

Identificar los órdenes: ACF y PACF

El método original de Box & Jenkins lee los órdenes en dos gráficas de una serie estacionaria: la función de autocorrelación (ACF) sugiere q (un proceso MA(q) se corta después del rezago q), la función de autocorrelación parcial (PACF) sugiere p (un proceso AR(p) se corta después del rezago p). En la práctica, la mayoría de las implementaciones ahora buscan en una malla de combinaciones (p,d,q) y eligen la que minimiza el AICc en lugar de leer gráficas a ojo — el algoritmo de Hyndman-Khandakar (Hyndman & Khandakar, 2008) automatiza justo esto y viene incluido como auto_arima en pmdarima de Python y ARIMA() en fable de R. SARIMAX de statsmodels ajusta un orden dado y también acepta regresores exógenos (la “X” de SARIMAX) para días festivos, promociones o precio.

ARIMA vs. suavizamiento exponencial

Ambos son baselines univariados estándar y ambos son modelos de espacio de estados por dentro, pero parten de supuestos distintos — y ninguna de las dos clases es universalmente superior (FPP3 §9.10):

ARIMAETS / Holt-Winters
ModelaAutocorrelación en errores (diferenciados)Nivel, tendencia y estacionalidad directamente
Necesita estacionariedadSí (vía diferenciación)No
Forma estacionalMultiplicativa necesita transformación logAditiva o multiplicativa nativa
Uso típicoSeries con autocorrelación fuerte, señales de ingeniería/econometríaSeries con tendencia/estacionalidad clara, demanda de negocio

Ver nuestro post de suavizamiento exponencial para el lado de ETS. Ninguno domina universalmente — evalúa ambos fuera de muestra con cross-validation de origen rodante y quédate con el que gane.

Checklist

  • Confirma estacionariedad (o diferencia hasta lograrla) antes de ajustar términos AR/MA.
  • Para datos estacionales, usa SARIMA o ajusta ETS en su lugar — un ARIMA simple se perderá el ciclo.
  • Prefiere la búsqueda automática basada en AICc (Hyndman-Khandakar) sobre leer ACF/PACF a mano en pipelines de producción.
  • Compara siempre contra un pronóstico naïve/naïve-estacional y contra ETS — reporta el que gane con datos nunca vistos, no por suposición.

ARIMA y SARIMA son parte de la librería de modelos que Forecast Studio entrena y compara automáticamente para cada serie — puedes ajustar uno con datos reales y verlo lado a lado con alternativas de ML en el tenant público del plan Free.

Fuentes: Box & Jenkins, Time Series Analysis: Forecasting and Control (Wiley) · Hyndman & Athanasopoulos, FPP3 §9 · Hyndman & Khandakar (2008), JSS · Makridakis, Spiliotis & Assimakopoulos (2020), IJF — Competencia M4 · statsmodels SARIMAX