Agentic AI</strong está revolucionando la investigación científica. Los científicos de IA pueden leer documentos, proponer hipótesis, seleccionar modelos y decidir qué experimentos priorizar. Originalmente, su valor se demostró en la ingeniería de software, donde los agentes de codificación escriben, prueban y lanzan código de producción. Sin embargo, la investigación científica es más exigente y cíclica, ya que los investigadores constantemente evalúan evidencia, refinan hipótesis y realizan experimentos que influyen en decisiones futuras.
Además, los problemas científicos a menudo requieren herramientas específicas de cada dominio, como el plegamiento de proteínas o la caracterización de moléculas. Orquestar y operar estas herramientas puede ser complicado, ya que paquetes similares pueden tener requisitos de entorno o API muy diferentes. Un agente de propósito general podría reconocer que una tarea requiere el plegamiento de proteínas, pero no sabría qué modelo ejecutar ni cómo formatear la solicitud.
NVIDIA BioNeMo Agent Toolkit
El NVIDIA BioNeMo Agent Toolkit cierra esa brecha. Este conjunto de herramientas agrupa más de una década de modelos, bibliotecas y flujos de trabajo de ciencias de la vida de NVIDIA en habilidades llamables por agentes para biología, química, genómica y descubrimiento de fármacos. Construido para funcionar con cualquier marco de agente, permite flujos de trabajo científicos complejos utilizando experiencia especializada en el dominio.
En pruebas internas, las habilidades de BioNeMo incrementan la corrección de tareas del 60% al 100% y aproximadamente duplican la eficiencia de tokens. Este artículo utiliza Claude Science, la plataforma de trabajo de IA de Anthropic para la investigación científica, junto con el NVIDIA BioNeMo Agent Toolkit y NVIDIA NIM para ejecutar predicciones de estructuras de proteínas con alineación de múltiples secuencias (MSA) utilizando múltiples modelos de plegamiento y comparar resultados.
Configuración
NVIDIA y Anthropic colaboraron para integrar el BioNeMo Agent Toolkit en Claude Science, permitiendo que los agentes descubran, inicien y llamen a microservicios NIM de BioNeMo directamente. Claude Science opera en diversas configuraciones, dependiendo de la ubicación de su GPU y de sus requisitos de seguridad. Este tutorial se centra en ejecutar la plataforma en una máquina con GPU.
Se necesita acceso a una estación de trabajo o máquina en la nube con una GPU NVIDIA L40S o NVIDIA H100 y Claude Science instalado. La máquina necesita alrededor de 700 GB de almacenamiento para este flujo de trabajo: la base de datos UniRef30 del msa-search NIM ocupa aproximadamente 490 GB, y los contenedores Boltz-2 y OpenFold3 suman entre 30 y 40 GB. Por defecto, Claude Science opera en un entorno aislado, y ejecutar microservicios NIM de BioNeMo requiere puntos de cómputo que expongan recursos de GPU locales o remotos.
Pasos
Con los tres puntos finales NIM en funcionamiento, Claude Science organiza el flujo de trabajo de predicción de estructuras. Este tutorial examina la proteína Seh1 y un socio propuesto de la familia Mio de Paracoccidioides lutzii, un hongo que causa paracoccidioidomicosis. La elección de este ejemplo está motivada por un estudio que amplía las estructuras cuaternarias a escala del proteoma. La proteína Seh1 y los proteínas de la familia Mio participan en maquinaria de detección de nutrientes conservada.
Este tutorial utiliza un sistema de dos proteínas de Paracoccidioides lutzii: la proteína de poro nuclear Seh1 (C1GY11) y un socio propuesto no caracterizado (C1HCX1). La pregunta estructural planteada es cómo difiere la estructura predicha de Seh1 cuando se modela sola en comparación con el modelo que incluye al socio propuesto.
Generar MSAs
El agente recupera ambas secuencias proteicas de UniProt y crea dos tipos de alineación. Primero, genera una alineación no emparejada para cada proteína, proporcionando información sobre la estructura de cada cadena. Luego, crea una alineación emparejada al coincidir versiones relacionadas de las dos proteínas encontradas en la misma especie.
En esta ejecución, la búsqueda devolvió 202 secuencias para cada proteína. El agente registró la fuente y la secuencia para Seh1 (384 residuos) y C1HCX1 (976 residuos), sin modificar ni proporcionar plantillas estructurales o ligandos. Para realizar la alineación, use el siguiente aviso:
I’m comparing the Seh1 protein C1GY11 on its own and with C1HCX1. Load the msa-search-nim skill and download both current FASTA sequences from UniProt. Save where each sequence came from, when you downloaded it, its accession, length, checksum, and chain ID: use A for C1GY11 and B for C1HCX1. Create an A3M alignment for each protein with the MSA Search NIM. Use Uniref30_2302 only, the ColabFold search type, an E-value of 0.0001, and up to 500 sequences. Then create a paired A3M for the two proteins, in A-then-B order, using greedy pairing. Save the request, response, A3M files, endpoint, metrics, and any errors. If you cannot make the paired alignment, stop and tell me; do not quietly replace it with a different kind of alignment.
Predicción de estructura con OpenFold3
OpenFold3 toma una lista de moléculas con msa por cadena (no emparejada) y, en el caso de complejos, paired_msa. El agente ejecuta dos condiciones con la misma secuencia Seh1: el monómero (cadena A con su MSA) y el heterómero (cadenas A y B con sus MSAs más el MSA emparejado). Se utiliza salida en mmCIF, sin plantillas, y se almacenan todas las muestras devueltas y los campos de confianza expuestos por el servicio.
El proceso se repite con Boltz-2, el cual genera una gama más rica de salidas de confianza. El modelo Boltz-2 no tiene un campo paired_msa separado, ya que toma un MSA por cadena y empareja internamente. Se repiten las mismas predicciones con Boltz-2, guardando los resultados y analizando todas las salidas para proporcionar un resumen.
Inspeccionar la estructura producida
Finalmente, el agente examina si el socio propuesto cambia la estructura predicha de Seh1. Se superponen las cadenas Seh1 del monómero y heterómero, analizando la región β-propulsora WD40. Los modelos predicen una interacción entre C1GY11 y C1HCX1, aunque no verificada experimentalmente. El verdadero valor de este flujo de trabajo radica en proporcionar una manera reproducible y respaldada por evidencia para formular y examinar estas hipótesis estructurales, dejando la validación final a la experimentación.
Comienza ahora
El BioNeMo Agent Toolkit permite a los agentes de Claude Science generar MSAs, ejecutar predicciones de estructura basadas en NIM y preservar artefactos para revisión. Explora el toolkit en GitHub para aplicar este flujo de trabajo a otros monómeros y complejos.


