BLIP-2: visión y lenguaje
Marco de preentrenamiento visión-lenguaje que conecta codificadores de imagen congelados con LLM, para descripción de imágenes, respuesta a preguntas visuales…
Marco de preentrenamiento visión-lenguaje que conecta codificadores de imagen congelados con LLM, para descripción de imágenes, respuesta a preguntas visuales…