La nube de Alibaba ha presentado al mundo Qwen-Image-2.1, una herramienta de inteligencia artificial que fusiona la generación y edición de imágenes en un solo sistema. Su principal atractivo reside en ser un modelo de 7.000 millones de parámetros, lo que lo hace ligero para instalar localmente, y con la capacidad novedosa de crear imágenes que incorporan transparencia.
El equipo de investigación detrás de Qwen ha puesto a disposición pública este modelo de pesos abiertos. Se destaca por su arquitectura compacta de 7B que no solo permite trabajar con transparencia, sino que también admite hasta diez imágenes de referencia. Esto habilita aplicaciones que van desde panorámicas e infografías hasta pruebas virtuales y tipografías.
Rendimiento eficiente y accesible
Una de las virtudes de Qwen-Image-2.1 es su relación entre rendimiento y consumo de recursos. Al requerir menos memoria de vídeo gracias a su tamaño de 7B, se vuelve viable en equipos con hardware de menor potencia, como GPU de gama media o servidores pequeños. Esto amplía su accesibilidad tanto para empresas como para usuarios individuales.
En el aspecto de la transparencia nativa en canales alpha / RGBA, el modelo supera a competidores como Nano Banana Pro de Google. Es capaz de extraer sujetos u objetos de fotos convencionales para usarlos en capas en programas de edición como Photoshop, o para insertarlos directamente en un chat sin el molesto fondo blanco o negro.
Qwen-Image-2.1 también ofrece soporte para hasta diez imágenes de referencia simultáneas. Con ellas, los usuarios pueden combinar personas, prendas de vestir o cualquier tipo de artículo para generar composiciones personalizadas y ajustadas a sus necesidades.
Edición precisa y fidelidad visual
En el apartado de edición, el modelo permite señalar las áreas a modificar mediante círculos de colores o marcadores. Además, mantiene la fidelidad en retratos y preserva detalles como texto, textura y forma durante las modificaciones, algo crucial para trabajos profesionales.
Por último, el nuevo modelo de IA de Alibaba Cloud es capaz de generar panorámicas e infografías complejas a partir de fotos, así como de producir historias en formato de guion gráfico usando diseños de personajes de tres vistas como base.
La compañía también ha resaltado que la tipografía da un salto de calidad: el estilo, la distribución y la integración con la escena se respetan, ofreciendo detalles más realistas en retratos e iluminación.
Este lanzamiento ocurre poco después de la presentación de Qwen3.8-Omni-Flash, un avance en procesamiento de voz e interacción de audio. Así, en cuestión de días, el laboratorio de IA se ha acercado a los modelos cerrados en áreas clave como edición avanzada de imágenes, multimodalidad eficiente y accesibilidad de código abierto.
Fuente: Infobae