Alibaba ha lanzado un modelo de inteligencia artificial pequeño que rivaliza con los grandes sistemas en la nube. Se llama Qwen3.8-27B. «Pesa» 27.000 millones de parámetros, una cifra modesta si se compara con los gigantes del sector. Aun así, sus resultados en pruebas independientes igualan a modelos mucho más grandes. La cifra de descargas ha sorprendido incluso a analistas experimentados. En pocos días superó el millón de descargas en Hugging Face, y algunas fuentes hablan ya de tres millones en menos de una semana. El modelo entiende texto, imagen y vídeo. Se puede ejecutar en un ordenador de sobremesa potente o en un portátil bien equipado, sin depender de un servicio de pago en la nube. El detalle que más llama la atención es su forma de razonar: piensa mucho antes de responder, y eso tiene un coste directo en velocidad. En este artículo repasamos qué hace especial a este modelo, cómo se compara con la competencia y por qué Alibaba apuesta por el tamaño reducido como estrategia de futuro.
Un modelo pequeño con resultados de primera línea
Qwen3.8-27B ha llamado la atención por igualar a rivales con muchísimos más parámetros. La firma de análisis independiente Artificial Analysis le otorgó una puntuación de 52 en su Intelligence Index, un compuesto de nueve pruebas que abarca programación, ciencia y razonamiento. Esa cifra coincide con la que obtiene GPT-5.6 Luna de OpenAI en su configuración de razonamiento más exigente. El dato sitúa a Qwen3.8-27B en primera posición dentro de su categoría, formada por 135 modelos evaluados. También se acercó a dos pesos pesados chinos de código abierto: rozó los resultados de DeepSeek V4-Pro, un modelo de 1,7 billones de parámetros, y quedó cerca de GLM-5.2 de Zhipu, con 753.000 millones de parámetros. Alibaba, por su parte, publicó cifras propias antes de conocerse las independientes: 61,7 puntos en SWE-bench Pro y 90,3 en LiveCodeBench, superando en su propia tabla a un resultado atribuido a Claude Opus 4.6. Conviene matizar ese dato. Algunas de esas evaluaciones fueron internas y los entornos de prueba no eran idénticos, así que no sirven como base sólida para declarar un ganador absoluto.
Lo que de verdad importa: el hardware necesario
El verdadero atractivo de Qwen3.8-27B no está solo en las puntuaciones, sino en dónde puede ejecutarse. La versión de precisión completa exige unos 56 GB de memoria de GPU, una cantidad reservada hasta ahora a estaciones de trabajo profesionales. La versión comprimida en 4 bits reduce ese requisito a apenas 17 GB, un tamaño de archivo que cabe en el disco de cualquier portátil moderno. Ese salto es lo que ha empujado a tantos desarrolladores a probarlo en casa, sin recurrir a servidores externos. El programador y divulgador Simon Willison ejecutó la versión comprimida tanto en un portátil de Apple como en un equipo de sobremesa con tarjeta Nvidia, según explicó en su blog personal, en un artículo disponible en simonwillison.net. El modelo escribió código, interpretó imágenes y completó un bucle de agente de programación sin salir de esas dos máquinas domésticas. Willison describió la experiencia como casi milagrosa, dado que un archivo de apenas 17 GB era capaz de realizar tareas que hasta hace poco requerían infraestructura en la nube.
El precio a pagar: velocidad
La contrapartida de tanta calidad es la lentitud. Qwen3.8-27B genera muchísimo más texto de razonamiento interno que sus competidores antes de dar una respuesta final. Según recoge un análisis publicado en VentureBeat, Artificial Analysis registró 160 millones de tokens de salida durante sus pruebas con este modelo, frente a una media de 43 millones en modelos abiertos comparables. Willison comprobó ese mismo problema de primera mano: una simple petición para dibujar una imagen sencilla tardó 21 minutos y consumió más de 22.000 tokens de razonamiento, porque el modelo arranca por defecto en su nivel de esfuerzo más alto. Su recomendación práctica es bajar ese nivel para el uso doméstico habitual. También apuntó una vía de mejora: al activar una función llamada Multi-Token Prediction, registró una ganancia de rendimiento cercana al 72 % en su máquina con Nvidia. El inversor Tomasz Tunguz llegó a una conclusión parecida tras probar el modelo en su propia infraestructura de agentes. Con el razonamiento activado, Qwen ofrecía algo más de calidad, pero a costa de una lentitud notable frente a los modelos en la nube. Tunguz avisó de que sus nueve pruebas eran demasiado pocas para sacar conclusiones firmes, y defendió que la métrica relevante no es la velocidad de generación de tokens, sino el tiempo total hasta obtener una respuesta terminada.
Por qué Alibaba apuesta por lo pequeño
La jugada de Alibaba encaja con una tendencia que ya se venía observando. Datos de Hugging Face recogidos por medios especializados muestran que el uso real se inclina hacia modelos pequeños, aunque los grandes lanzamientos sean los que acaparan titulares. Los modelos por encima de 70.000 millones de parámetros representaron solo una fracción reducida de las descargas de 2026. Alibaba ha construido su familia Qwen precisamente sobre esa idea, publicando versiones en varias categorías de tamaño hasta convertirla en una de las líneas de modelos abiertos más descargadas. La compañía ya trabaja en una versión gestionada en la nube de este mismo modelo, con una ventana de contexto de un millón de tokens y herramientas integradas, aunque todavía no tiene fecha de lanzamiento confirmada. Por ahora, el mensaje de fondo es sencillo: un archivo lo bastante pequeño para vivir en un portátil puede hacer un trabajo que hasta hace poco pertenecía a los sistemas alojados más grandes del mercado.
El dato que confirma el interés del mercado
El ritmo de adopción respalda esa idea. Según recoge The Information, Qwen3.8-27B se convirtió en uno de los modelos de Alibaba de más rápido crecimiento hasta la fecha, con más de un millón de descargas en apenas unos días desde su publicación. El modelo se distribuye bajo licencia Apache 2.0, lo que permite a cualquier empresa inspeccionar, modificar y alojar el modelo por su cuenta sin restricciones comerciales. Esa combinación de apertura y rendimiento explica buena parte del ruido generado en foros de desarrolladores. La herramienta de programación asistida Cline llegó a describirlo como la primera vez que un modelo local alcanza capacidades propias de la frontera tecnológica, tras superar en su propia prueba de tareas de agente a la configuración de máximo razonamiento de Claude Opus 4.8, un modelo lanzado por Anthropic apenas tres meses antes.
Reflexiones finales
Qwen3.8-27B no es el modelo más potente del mercado, pero sí uno de los más significativos del año. Demuestra que la brecha entre lo que corre en la nube y lo que corre en casa se está estrechando a buen ritmo. La lentitud sigue siendo un obstáculo real para el uso diario, sobre todo en tareas donde la respuesta inmediata importa más que la profundidad del razonamiento. Aun así, para quienes valoran la privacidad, el control total sobre sus datos o simplemente quieren experimentar sin factura mensual, este tipo de modelo abre una puerta que hace poco parecía cerrada. En PcDeMaNo seguiremos de cerca cómo evoluciona este enfoque de modelos compactos, sobre todo si llegan a integrarse en equipos domésticos como los que solemos analizar en nuestras reseñas de hardware para autoalojamiento.
10