Logo de dizzgo Research.
Regresar

Evaluación de riesgo crediticio mediante machine learning para la inclusión financiera en zonas rurales

23 de julio de 2026

Keywords:riesgo crediticiomachine learninginclusion financierascoringdatos alternativos

Resumen

Los modelos de scoring crediticio tradicionales excluyen estructuralmente a quien nunca tuvo crédito: sin historial no hay puntaje, y sin puntaje no hay primer crédito. Este trabajo evalúa si el uso de datos alternativos permite romper ese ciclo, y bajo qué condiciones hacerlo no introduce nuevas formas de exclusión.

El estudio forma parte de la línea de investigación Nexa de Dizzgo Research.


Contexto

En las zonas rurales del sur del Perú, una proporción significativa de la actividad económica se desarrolla fuera del sistema financiero formal. Los pequeños comercios operan mayoritariamente en efectivo y no generan los registros que un modelo de scoring convencional necesita.

El resultado es un ciclo de exclusión:

  • Sin historial crediticio no se puede estimar riesgo.
  • Sin estimación de riesgo la entidad no otorga crédito.
  • Sin crédito no se genera historial.

Datos

Se trabajó con un conjunto anonimizado de 8 400 solicitudes de microcrédito recolectadas entre 2022 y 2025, de las cuales 3 100 corresponden a solicitantes sin historial bancario previo.

Variables tradicionales

Historial de pagos previos, antigüedad crediticia, nivel de endeudamiento y consultas recientes al buró.

Variables alternativas

  • Regularidad de recargas y pagos de servicios.
  • Antigüedad y estabilidad del domicilio declarado.
  • Patrones de uso de billeteras digitales.
  • Estacionalidad de ingresos declarados.

Ninguna variable utilizada codifica de forma directa género, origen étnico o afiliación política. La evaluación de equidad, sin embargo, se realizó sobre atributos protegidos disponibles únicamente para ese análisis.


Metodología

Se entrenaron tres modelos:

  1. Regresión logística sobre variables tradicionales, como línea base del sector.
  2. Gradient boosting sobre variables tradicionales.
  3. Gradient boosting sobre el conjunto combinado de variables tradicionales y alternativas.

La validación se realizó de forma temporal: entrenamiento con solicitudes anteriores a 2024 y evaluación sobre las posteriores, evitando la fuga de información que produce una partición aleatoria en datos con componente temporal.

Además de AUC, se midieron tasas de falsos positivos y negativos desagregadas por sexo y por zona de residencia.


Resultados

Capacidad predictiva

Modelo AUC (población total) AUC (sin historial)
Logística tradicional 0.71 0.54
Boosting tradicional 0.76 0.57
Boosting con datos alternativos 0.79 0.72

La diferencia relevante no está en la población general — donde la mejora es moderada — sino en el subgrupo sin historial bancario, donde los modelos tradicionales apenas superan el azar y el modelo con datos alternativos alcanza un desempeño utilizable.

Cobertura

Aplicando un umbral de aprobación equivalente en tasa de morosidad esperada, el modelo con datos alternativos aprueba un 31 % más de solicitantes sin historial previo.

Equidad

El análisis desagregado mostró una tasa de falsos negativos 6.2 puntos superior para solicitantes de zonas con menor penetración de billeteras digitales. El origen es directo: la señal más predictiva del modelo está menos disponible precisamente en las zonas menos conectadas.


Discusión

El uso de datos alternativos resuelve el problema de partida — permite evaluar a quien no tiene historial — pero traslada el sesgo en lugar de eliminarlo. Donde el modelo tradicional excluía por ausencia de historial bancario, el modelo alternativo penaliza la ausencia de huella digital.

Este desplazamiento es menos visible que la exclusión original, y por eso más problemático: un solicitante rechazado por falta de historial entiende el motivo, mientras que uno rechazado por baja actividad digital difícilmente puede identificar la causa ni corregirla.

Cualquier despliegue responsable de este tipo de modelo exige monitoreo continuo de las tasas de error desagregadas y una vía de revisión manual para los casos con señal alternativa escasa.


Limitaciones

  • Los datos provienen de una única región; la generalización a otras zonas no está verificada.
  • El etiquetado de incumplimiento usa una ventana de 12 meses que puede subestimar la morosidad tardía.
  • No se evaluó la estabilidad del modelo ante cambios en el comportamiento de pago digital.
  • El análisis de equidad se limitó a dos atributos protegidos.

Conclusiones

  • Los datos alternativos elevan el AUC de 0.57 a 0.72 en solicitantes sin historial bancario.
  • La cobertura de aprobación aumenta un 31 % a igualdad de riesgo esperado.
  • El modelo introduce un sesgo nuevo asociado a la penetración digital de la zona de residencia.
  • El monitoreo de equidad desagregada debe formar parte del despliegue, no de una auditoría posterior.

Trabajo futuro

  • Replicar el estudio en regiones con distinta penetración digital.
  • Evaluar técnicas de mitigación de sesgo aplicadas al conjunto de variables alternativas.
  • Diseñar un mecanismo de revisión manual para solicitantes con señal alternativa escasa.
  • Extender la ventana de observación de incumplimiento a 24 meses.