Lanzan SyGra Studio: una herramienta visual para generar datos sintéticos

SyGra 2.0.0 presenta Studio, un entorno interactivo que facilita la generación de datos sintéticos de manera visual y transparente. En lugar de manejar archivos YAML y terminales, puedes componer flujos directamente en un lienzo, previsualizar conjuntos de datos antes de confirmar, ajustar indicaciones con sugerencias de variables en línea y observar la ejecución en tiempo real, todo desde una única interfaz.

Detrás de esta interfaz, el funcionamiento es el mismo, lo que significa que cada acción visual genera la configuración de gráfico compatible con SyGra y los scripts del ejecutor de tareas correspondientes.

Lo que Studio te permite hacer

  1. Configurar y validar modelos mediante formularios guiados (OpenAI, Azure OpenAI, Ollama, Vertex, Bedrock, vLLM, puntos finales personalizados).
  2. Conectar fuentes de datos de Hugging Face, sistema de archivos o ServiceNow y previsualizar filas antes de la ejecución.
  3. Configurar nodos seleccionando modelos, escribiendo indicaciones (con variables sugeridas automáticamente) y definiendo salidas o esquemas estructurados.
  4. Diseñar salidas posteriores utilizando variables de estado compartidas y asignaciones impulsadas por Pydantic.
  5. Ejecutar flujos de extremo a extremo y revisar los resultados generados al instante con progreso a nivel de nodo.
  6. Depurar con registros en línea, puntos de interrupción, editores de código basados en Monaco y borradores guardados automáticamente.
  7. Monitorear el costo por ejecución, latencia y resultados de guardarrails con el historial de ejecución almacenado en .executions/.

A continuación, abordaremos esta experiencia paso a paso.

Paso 1: Configurar la fuente de datos

Abre Studio, haz clic en Crear flujo y los nodos de Inicio/Fin aparecerán automáticamente. Antes de añadir más elementos:

  • Elige un conector (Hugging Face, disco o ServiceNow).
  • Introduce parámetros como repo_id, división o ruta de archivo, luego haz clic en Previsualizar para obtener filas de muestra.
  • Los nombres de las columnas se convierten inmediatamente en variables de estado (por ejemplo, {prompt}, {genre}), lo que permite saber exactamente qué se puede referenciar dentro de indicaciones y procesadores.

Una vez validada, Studio mantiene la configuración sincronizada y conecta esas variables a lo largo del flujo, sin necesidad de cableado manual ni suposiciones.

Paso 2: Construir el flujo visualmente

Arrastra los bloques necesarios desde la paleta. Para un pipeline de generación de historias:

  1. Coloca un nodo LLM llamado “Generador de Historias”, selecciona un modelo configurado (por ejemplo, gpt-4o-mini), escribe la indicación y almacena el resultado en story_body.
  2. Agrega un segundo nodo LLM llamado “Resumidor de Historias”, referencia {story_body} dentro de la indicación y produce la salida en story_summary.
  3. Activa las salidas estructuradas, adjunta herramientas o añade nodos Lambda/Subgrafo si necesitas lógica reutilizable o comportamiento de ramificación.

El panel de detalles de Studio mantiene todo en contexto: parámetros del modelo, editor de indicaciones, configuración de herramientas, código de pre/post-procesamiento, e incluso configuraciones de múltiples LLM si deseas generaciones paralelas. Al escribir { dentro de una indicación, aparecen instantáneamente todas las variables de estado disponibles.

Paso 3: Revisar y ejecutar

Abre el Panel de Código para inspeccionar el YAML/JSON exacto que Studio está generando. Este es el mismo artefacto que se escribe en tasks/examples/, por lo que lo que ves es lo que se va a comprometer.

Cuando estés listo para ejecutar:

  • Haz clic en Ejecutar Flujo de Trabajo.
  • Selecciona recuentos de registros, tamaños de lote, comportamiento de reintento, etc.
  • Presiona Ejecutar y observa cómo el panel de Ejecución transmite el estado de los nodos, uso de tokens, latencia y costo en tiempo real. Los registros detallados proporcionan observabilidad y facilitan la depuración. Todas las ejecuciones se escriben en .executions/runs/*.json.

Después de la ejecución, descarga las salidas, compáralas con ejecuciones anteriores y obtén metadatos sobre detalles de latencia y uso.

¡Velo en acción!

Ejecución de Flujos de Trabajo Existentes

Ejecutar el flujo de trabajo Glaive Code Assistant

SyGra Studio también puede ejecutar flujos de trabajo existentes en tasks. Por ejemplo, en el tasks/examples/glaive_code_assistant/ flujo de trabajo, se ingesta el glaiveai/glaive-code-assistant-v2 conjunto de datos, se redactan respuestas, se critican y se repite hasta que la crítica devuelva “NO MORE FEEDBACK”.

Dentro de Studio notarás:

  1. Diseño de lienzo – dos nodos LLM (generate_answer y critique_answer) vinculados por un borde condicional que redirige de nuevo para más revisiones o sale a FIN cuando la crítica es satisfactoria.
  2. Entradas ajustables – el modal de Ejecución permite cambiar las divisiones de conjuntos de datos, ajustar tamaños de lote, limitar registros o modificar temperaturas sin tocar YAML.
  3. Ejecución observable – observa cómo ambos nodos se iluminan en secuencia, inspecciona críticas intermedias y monitorea el estado en tiempo real.
  4. Salidas generadas – se generan datos sintéticos, listos para entrenamiento de modelos, pipelines de evaluación o herramientas de anotación.

Comienza

git clone https://github.com/ServiceNow/SyGra.git cd SyGra && make studio 

SyGra Studio convierte los flujos de trabajo de datos sintéticos en una experiencia visual y amigable. Configura una vez, construye con confianza, ejecuta con total visibilidad y genera datos sin salir del lienzo.

Ilustración de un hombre mayor con auriculares y chaqueta