Sentence Transformers es una biblioteca de Python diseñada para utilizar y entrenar modelos de incrustación y reranking. Se aplica en áreas como la generación aumentada por recuperación y la búsqueda semántica. Con la actualización v5.4, ahora puedes codificar y comparar textos, imágenes, audio y videos utilizando la misma API familiar. Este artículo mostrará cómo aprovechar estas nuevas capacidades multimodales para la incrustación y el reranking.
Los modelos de incrustación multimodal asignan entradas de diferentes modalidades a un espacio de incrustación compartido. Por otro lado, los modelos de reranking multimodal evalúan la relevancia de pares de modalidades mixtas. Esto abre posibilidades como la recuperación de documentos visuales, la búsqueda cruzada de modalidades y las tuberías RAG multimodales.
¿Qué son los modelos multimodales?
Los modelos de incrustación tradicionales convierten el texto en vectores de tamaño fijo. Los modelos de incrustación multimodal amplían esto al asignar entradas de diferentes modalidades (texto, imágenes, audio o video) a un espacio de incrustación compartido. Esto permite, por ejemplo, comparar una consulta de texto con documentos de imagen utilizando las mismas funciones de similitud que ya conoces.
Del mismo modo, los modelos de reranking tradicionales (Cross Encoder) calculan puntajes de relevancia entre pares de textos. Los rerankers multimodales pueden evaluar pares donde uno o ambos elementos son imágenes, documentos combinados de texto e imagen, o cualquier otra modalidad.
Instalación
Los modelos multimodales requieren dependencias adicionales. Instala los extras necesarios para las modalidades que necesites consultando la guía de instalación:
pip install -U "sentence-transformers[image]"
pip install -U "sentence-transformers"
pip install -U "sentence-transformers"
pip install -U "sentence-transformers[image,video,train]"
Los modelos basados en VLM, como Qwen3-VL-2B, requieren una GPU con al menos ~8 GB de VRAM. Para las variantes de 8B, se espera ~20 GB. Si no tienes una GPU local, considera usar un servicio de GPU en la nube o Google Colab. En CPU, estos modelos serán extremadamente lentos; los modelos solo de texto o CLIP son más adecuados para la inferencia en CPU.

