Agentes LLM triunfan en competencia de Kaggle con codificación asistida por IA

Tres agentes LLM lograron generar más de 600,000 líneas de código y ejecutar 850 experimentos, lo que les permitió obtener un primer lugar en una competencia de Kaggle.

El éxito en las competiciones modernas de aprendizaje automático se define cada vez más por la rapidez en la generación, prueba e iteración de ideas. Los agentes LLM, combinados con la aceleración de GPU, comprimen notablemente este ciclo.

Tradicionalmente, dos cuellos de botella han limitado esta experimentación:

  • La velocidad de escritura de código para nuevos experimentos.
  • La rapidez en la ejecución de esos experimentos.

Las GPUs y bibliotecas como NVIDIA cuDF, NVIDIA cuML, XGBoost y PyTorch han resuelto en gran medida el segundo problema. Los agentes LLM abordan el primero, desbloqueando una nueva escala de experimentación rápida e iterativa.

Este artículo describe cómo utilicé agentes LLM para acelerar el descubrimiento de las soluciones de predicción más efectivas en datos tabulares.

Estudio de caso: Predicción de churn en Kaggle Playground

La competencia de Kaggle Playground de marzo de 2026 retó a los participantes a predecir la pérdida de clientes en telecomunicaciones, midiendo el rendimiento por el área bajo la curva (AUC), donde la solución más precisa gana.

La solución ganadora es una pila de cuatro niveles compuesta por 150 modelos, seleccionados de un total de 850.

Figura 1. Diagrama que muestra cómo 150 modelos se combinan en una solución ganadora de cuatro niveles

Flujo de trabajo guiado por agentes LLM

En esta competencia de datos tabulares, guié a los agentes LLM para seguir el manual del Gran Maestro de Kaggle descrito en un artículo anterior.

Los agentes LLM siguen un flujo de trabajo comenzando con el análisis exploratorio de datos (EDA), luego construyendo líneas base, seguido de la ingeniería de características y, finalmente, combinando modelos a través de escalado y apilamiento.

La solución utilizó múltiples agentes LLM—GPT-5.4 Pro, Gemini 3.1 Pro, Claude Opus 4.6—en un flujo de trabajo con humano en el ciclo.

Paso 1: Los agentes LLM realizan EDA

Un agente LLM debe comprender la estructura de los datos antes de generar un pipeline completo.

Las preguntas clave incluyen:

  • ¿Cuántas filas y columnas hay en los conjuntos de entrenamiento y prueba?
  • ¿Cuál es la columna objetivo y cómo está formateada?
  • ¿Es la tarea de clasificación o regresión?
  • ¿Qué características están disponibles y cómo están formateadas?
  • ¿Cuáles son las características categóricas o numéricas?
  • ¿Hay datos faltantes?

Esta información puede ser proporcionada de antemano o inferida automáticamente a través de EDA.

Diagram showing an LLM Agent writing and running EDA code to explore data.
Figura 2. Los agentes LLM exploran los datos escribiendo y ejecutando código EDA

Si se usa un LLM en una ventana de chat, se puede solicitar:

 “Por favor, escribe código EDA para explorar los archivos CSV train.csv y test.csv. Ejecutaré el código y compartiré los gráficos y el texto contigo.” 

Si se utiliza un LLM con ejecución de código como Claude Code, se puede pedir al LLM que escriba y ejecute su propio código para comprender los datos.

 “Por favor, escribe y ejecuta código EDA para entender los archivos CSV train.csv y test.csv” 

Paso 2: Los agentes LLM construyen líneas base

Una vez que el LLM comprende los datos, específicamente las columnas de características y la columna objetivo, es el momento de escribir el primer pipeline completo para entrenar un modelo kfold pidiendo al LLM un modelo específico.

 “Por favor, escribe un pipeline de código completo para leer train.csv y test.csv y entrenar un modelo XGBoost kfold. Guarda las predicciones fuera de la muestra (OOF) y las predicciones de prueba en disco como archivos Numpy. Muestra el puntaje de la métrica de cada pliegue y en total.” 

Copia y pega el código de salida en tu base de código. Al usar un agente de línea de comando o IDE, permite que cree un Notebook de Python o Jupyter directamente.

Ejecuta el código para obtener tu primera puntuación de métrica CV, OOF y archivos de predicción de prueba.

Puedes pedir al LLM que construya una variedad de líneas base, incluidos modelos GBDT, NN y ML. Cada experimento reporta una puntuación CV y guarda las predicciones en disco como: “train_oof_[MODEL]_[VERSION].npy” y “test_preds_[MODEL]_[VERSION].npy”.

Estos archivos son importantes y los utilizaremos más adelante.

Paso 3: Los agentes LLM realizan ingeniería de características

Ahora tenemos una colección de modelos diversos y conocemos sus puntuaciones de métrica CV básicas. Podemos mejorar cada modelo con ingeniería de características y/o ajustes y mejoras del modelo. La ingeniería de características se centra en transformar los datos para que nuestros modelos puedan extraer más señal. Los agentes LLM son excelentes en ambas tareas.

Ejecutar experimentos de manera iterativa y mantener todas las ideas que mejoran los modelos conduce a modelos cada vez mejores. Para cada experimento, bueno o malo, siempre guarda las predicciones OOF y de prueba en disco.

Diagram showing an LLM Agent writing and running new feature engineering to improve model performance.
Figura 3. Los agentes LLM mejoran los modelos explorando repetidamente la ingeniería de características y evaluando el nuevo modelo

Los agentes LLM pueden escribir código tan rápido como deseamos. Para acelerar el ciclo, ejecutamos cada experimento lo más rápido posible utilizando siempre GPUs y bibliotecas de GPU como cuDF, cuML, y GPUs de árboles de decisión de refuerzo.

Para generar nuevas ideas, podemos proponerlas o permitir que los LLMs las generen. Hay muchas maneras efectivas de alentar a los LLMs a generar ideas, como:

  • Pedir a los LLMs que encuentren y lean artículos de investigación sobre el tema.
  • Pedir a los LLMs que lean foros y código compartido públicamente sobre el tema.
  • Pedir a los LLMs que realicen EDA para determinar relaciones entre características y objetivos para la ingeniería de características.
  • Pedir a los LLMs ideas basadas en la base de conocimientos actual.
  • Hacer que humanos realicen una lluvia de ideas con LLMs y creen ideas juntos.

Usando una de nuestras ideas, podemos pedir a un agente LLM que cree un nuevo código a partir de nuestro código anterior:

 “Por favor, escríbeme un código de reemplazo completo para el siguiente código que use XYZ en lugar de ABC”. 

¡Ahora tenemos un nuevo experimento para ejecutar!

Paso 4: Los agentes LLM combinan modelos

En este punto, tenemos muchos resultados de experimentos, cada uno con su propio modelo y diferente ingeniería de características guardada en un script de Python o Notebook de Jupyter. Los agentes LLM son expertos en combinar todos estos modelos e ideas, y pueden ayudarnos a utilizar y gestionar todos nuestros modelos de diversas maneras, como:

  • Resumir todos los tipos de modelos e ingeniería de características.
  • Combinar ideas de diferentes modelos y ingeniería de características para construir nuevos modelos más fuertes.
  • Construir conjuntos de diferentes modelos.
  • Apilar modelos sobre otros modelos.
  • Utilizar algunos modelos para etiquetar pseudo / destilar conocimiento en nuevos modelos más fuertes.

Una de las primeras cosas útiles que me gusta hacer es pedir a un agente LLM que resuma todos nuestros experimentos. Podemos arrastrar y soltar archivos en una ventana de chat o usar un agente de línea de comandos LLM (como Claude Code) para leer y agregar resultados de múltiples archivos. Esto nos ayuda a comprender mejor los datos y el problema, mostrándonos qué está funcionando.

Una técnica poderosa es pedir al agente LLM que combine múltiples ideas/modelos en un solo modelo.

 “¿Puedes leer todos estos archivos IPYNB y usar todas estas ideas para escribir un código completo para entrenar un nuevo modelo XGBoost que sea más fuerte que todos estos modelos?” 

Otra técnica es transferir el conocimiento de algunos o todos nuestros modelos a un solo modelo. Utilizamos nuestras predicciones OOF y de prueba (que son esencialmente etiquetas pseudo) para transferir conocimiento a un nuevo modelo más fuerte.

 “¿Puedes entrenar un nuevo modelo NN o GBDT utilizando la destilación del conocimiento de todas nuestras OOF y predicciones de prueba y hacer un nuevo modelo de alto rendimiento?” 

Ambas técnicas producen nuevos experimentos y nuevos archivos de predicción OOF y de prueba. Cada modelo base y experimento con nueva ingeniería de características y/o mejoras de modelo tiene un archivo de predicción OOF y de prueba asociado. Es común tener cientos de archivos. Ahora podemos pedir a los LLMs que combinen usando escalado y/o apilamiento.

 “¿Puedes intentar combinar todas nuestras OOF y predicciones de prueba usando varios modelos meta? Por favor, prueba escalado, regresión Ridge/Logística, NN y apiladores GBDT. Gracias” 

Resultados

Siguiendo los cuatro pasos mencionados, creamos un conjunto diverso de modelos. Luego mejoramos el rendimiento de cada modelo. Finalmente, combinamos todo en una solución potente. La ventaja radica en explorar muchas ideas rápidamente mediante la ejecución de modelos acelerados por GPU y agentes LLM que escriben código más rápido. Todos pueden emplear estas técnicas al buscar la solución más efectiva para sus tareas de predicción de datos tabulares.

Comienza

¿Listo para acelerar tus resultados? Comienza explorando las bibliotecas cuDF y cuML, así como CUDA-X para ciencia de datos.

Para profundizar, mejora tus habilidades con un taller DLI sobre ingeniería de características. Adquiere estrategias profesionales del artículo El Manual del Gran Maestro de Kaggle: 7 Técnicas de Modelado Probadas para Datos Tabulares.

Ilustración de un hombre mayor con auriculares y chaqueta