Visión y lenguaje con CLIP

Modelo de OpenAI que conecta visión y lenguaje, entrenado con 400 millones de pares imagen-texto. Permite clasificación de imágenes zero-shot, emparejamiento i…

/skills/multimodal-clip