c010rNews
Inteligencia artificial

Multiverse suelta Quasar 438B: un modelo comprimido para agentes que no es open source

La empresa española apuesta por la compresión para que un modelo de grandes parámetros sea rápido en tareas de IA, aunque cobra por API y oculta detalles de su arquitectura base.

3 min de lectura2 fuentes0 vistas

Multiverse Computing ha lanzado Quasar 438B, un modelo de lenguaje de 438 mil millones de parámetros diseñado específicamente para agentes de IA y programación. La propuesta de valor de la empresa española suena contradictoria a primera vista: un modelo de este calibre suele ser lento y caro, pero Multiverse asegura que su tecnología de compresión, CompactifAI, permite ejecutarlo con una latencia y coste adecuados para flujos de trabajo automatizados.

El modelo obtiene un 43 en el índice de inteligencia de Artificial Analysis y un 69.3 en Terminal-Bench v2.1. En términos de rendimiento bruto, supera a competidores europeos como Mistral Medium 3.5 (30 puntos) y NVIDIA Nemotron 3 Ultra (38 puntos). Sin embargo, queda por debajo de los líderes globales; Claude Opus 5 marca un 89.1 en ese mismo benchmark de código. Quasar no pretende ser el mejor modelo del mundo, sino una opción económica para tareas repetitivas donde el agente debe razonar, llamar a herramientas y verificar resultados constantemente.

Compresión y falta de detalles técnicos

Aquí es donde la noticia se complica para el ingeniero de sistemas. Multiverse afirma que su tecnología CompactifAI reduce el tamaño del modelo entre un 80% y un 95% con una pérdida mínima de precisión. El problema es que la empresa no ha revelado qué modelo base utilizó para crear Quasar ni el grado exacto de compresión aplicado. Tampoco ha especificado cuál es el hardware mínimo necesario para desplegarlo localmente, ni cómo afecta esa compresión a los requisitos de memoria y cómputo.

Para agentes que iteran sobre contextos largos, esto es crucial. Quasar ofrece una ventana de contexto de un millón de tokens y soporta inglés y español. Procesar tanta información requiere potencia, y aunque la compresión ayuda, sin datos concretos sobre el footprint de memoria o el consumo de GPU, es difícil calcular el coste real de operar agentes complejos que mantienen el estado durante toda la sesión.

En cuanto a la velocidad, Artificial Analysis registra una tasa de salida de aproximadamente 183 tokens por segundo. El tiempo hasta el primer token (TTFT) es de 1,1 segundos, y tarda unos 15,3 segundos en generar una respuesta de 500 tokens incluyendo el razonamiento. Son cifras decentes para un modelo de esta envergadura, pero un agente real introduce latencia adicional por las llamadas a herramientas externas y el crecimiento del contexto en cada turno.

Modelo propietario, acceso limitado

Quasar no es open source. Es un modelo propietario disponible exclusivamente a través de la API de Multiverse, CompactifAI. Los desarrolladores no pueden inspeccionar los pesos, ni auditar la efectividad real de la compresión, ni desplegarlo en su propia infraestructura para evitar la fuga de datos o reducir costes de egress. Esto cierra la puerta a la personalización local y obliga a depender de la nube de la empresa.

Multiverse llegó a este lanzamiento tras cerrar en julio una Serie C por 570 millones de dólares, fondos dedicados a expandir su biblioteca de modelos comprimidos. Se posiciona como una alternativa europea menos dependiente de los hyperscalers estadounidenses, aunque su estrategia es distinta a la de construir infraestructura propia: usan software para hacerlo correr en menos hardware.

La pregunta pendiente es si esas métricas de laboratorio se mantienen bajo carga real con agentes que fallan, recuperan contexto y ejecutan scripts. Hasta que Multiverse no publique documentación técnica sobre los requisitos de despligue o abra el modelo, Quasar será una caja negra rápida, pero opaca.

Relacionado