Las proteínas rara vez funcionan de manera aislada como monómeros individuales. La mayoría de los procesos biológicos se rigen por interacciones entre proteínas, formando complejos proteicos cuya estructura se describe en la jerarquía de la estructura proteica como representación cuaternaria.
Esto representa un nivel de complejidad superior a las representaciones terciarias, que son la estructura 3D de los monómeros, comúnmente conocidos desde la aparición de AlphaFold2 y la creación del Banco de Datos de Proteínas.
Desafíos en la predicción de estructuras
Aún no se dispone de información estructural para la gran mayoría de los complejos. Aunque la base de datos de estructuras proteicas de AlphaFold (AFDB), desarrollada conjuntamente por Google DeepMind y el Instituto Europeo de Bioinformática EMBL-EBI, transformó el acceso a estructuras de proteínas monoméricas, la biología estructural consciente de interacciones a escala del proteoma sigue siendo un obstáculo con desafíos únicos:
- Espacio de interacción combinatorial masivo
- Alto costo computacional para la generación de alineamientos de secuencias múltiples (MSA) y plegamiento de proteínas
- Escalabilidad en la inferencia a través de millones de complejos
- Calibración de confianza y evaluación comparativa
- Consistencia de conjuntos de datos e interpretabilidad biológica
Extensión de AFDB
En trabajos recientes, extendimos AFDB con predicciones a gran escala de complejos proteicos homoméricos generados por un pipeline de alto rendimiento basado en AlphaFold-Multimer, hecho posible por la computación acelerada de NVIDIA.
Además, predijimos complejos heteroméricos para comparar la precisión de diferentes modalidades de predicción de complejos.
Principios para aumentar el rendimiento
Este blog describe los principios principales adoptados para aumentar el rendimiento del plegamiento de proteínas, desde la adopción de bibliotecas y SDKs hasta optimizaciones para reducir la complejidad computacional del trabajo. Estos principios pueden ayudar a configurar un pipeline similar utilizando las técnicas que empleamos para crear este nuevo conjunto de datos.
Si eres un:
- Biologo computacional que escala pipelines de predicción de estructuras
- Investigador en IA que entrena modelos generativos de proteínas
- Ingeniero en HPC que optimiza cargas de trabajo de GPU
- Bioinformático construyendo recursos estructurales
Aprenderás a:
- Diseñar una estrategia de predicción de complejos a escala del proteoma
- Separar la generación de MSA de la inferencia de estructuras para mayor eficiencia
- Escalar flujos de trabajo de AlphaFold-Multimer a través de clústeres de GPU


