PrismML lanza Bonsai 2 27B: inteligencia artificial de 27B comprimida a solo 5.9 GB
El laboratorio de inteligencia artificial PrismML apuesta por una idea que va a contracorriente de la industria: los modelos de lenguaje capaces de razonar no tienen que ser gigantes. Su más reciente lanzamiento, Bonsai 2 27B, comprime el popular modelo de código abierto Qwen3.8 27B, desarrollado por Alibaba, hasta dejarlo en apenas 5.9 GB, un tamaño lo suficientemente reducido como para ejecutarse en una computadora personal y, posiblemente, en un teléfono inteligente de gama alta.
La cifra no es menor: equivale a una reducción de 9x a 10x en memoria frente al modelo original. Es decir, lo que antes exigía infraestructura de servidores ahora puede vivir dentro del dispositivo que el usuario ya tiene en sus manos.
Los datos clave del nuevo modelo Bonsai 2 27B
- Modelo lanzado: Bonsai 2 27B
- Modelo base comprimido: Qwen3.8 27B, de Alibaba
- Tamaño final: 5.9 GB
- Reducción de memoria: 9x a 10x respecto al original
- Rendimiento: 98% de las puntuaciones agregadas de referencia de Qwen
- Técnica de compresión: pesos ternarios (+1, −1 o 0)
- Empresa: PrismML, liderada por Babak Hassibi

Pesos ternarios: el secreto de la compresión de modelos LLM
PrismML asegura haber alcanzado este resultado reduciendo los «weights» o pesos que componen un modelo, es decir, la información que el modelo aprende y almacena durante su entrenamiento. Normalmente, cada peso requiere 16 bits. El enfoque de la compañía, denominado pesos «ternary» (ternarios), lo simplifica a solo tres valores posibles: +1, −1 o 0. Al tener valores mucho más pequeños que almacenar por cada peso, el modelo ocupa un espacio drásticamente menor.
«Hay más espacio para poder comprimirlos sin perder la inteligencia. Diría que, como tendencia general, para los modelos más grandes es más fácil llegar al 100%», explicó Babak Hassibi, CEO de PrismML.
De 95% a 98%: la evolución del rendimiento de Bonsai
El avance no es aislado. Hassibi sostiene que la tecnología de compresión de PrismML es única porque sus modelos de lenguaje han perdido prácticamente nada de rendimiento frente a los originales. Bonsai 2 iguala el 98% de las puntuaciones agregadas de referencia de Qwen, una mejora frente al primer Bonsai, lanzado apenas un par de meses atrás, en marzo, que alcanzaba el 95%.
| Versión del modelo | Momento de lanzamiento | Rendimiento frente al modelo original |
|---|---|---|
| Bonsai (primera versión) | En marzo | 95% |
| Bonsai 2 27B | Este jueves | 98% |
Los resultados demuestran que la compresión de PrismML ha mejorado de un lanzamiento a otro. Si algún día podrá alcanzar una paridad total del 100% en los benchmarks es una pregunta que aún queda por resolverse. La compresión, según Hassibi, probablemente siempre tendrá algún impacto.
Sin embargo, la paridad perfecta en las pruebas de referencia es un asunto más bien académico. Los modelos de lenguaje no son tan precisos en su forma sin comprimir, y las pruebas de referencia no reflejan con tanta exactitud las tareas reales como para que una degradación del 2% afecte de manera significativa el desempeño de un modelo en su uso cotidiano. A ello se suma que el software que rodea al modelo —el entorno en el que se ejecuta— también influye mucho en la precisión.
Más de 11 millones de descargas y el respaldo de inversionistas
El primer modelo Bonsai ya ha sido descargado más de 11 millones de veces, mientras que los modelos aún más pequeños de PrismML acumulan otras 2.6 millones de descargas, según datos de la propia compañía.
PrismML fue fundada por un grupo de investigadores de Caltech y está liderada por Babak Hassibi, profesor de esa institución y experto en tecnologías de compresión. La startup cuenta además con Ion Stoica como asesor: Stoica es cofundador de Databricks y de otras empresas, además de director del reconocido Sky Computing Lab de Berkeley, del que han nacido múltiples tecnologías y startups. Entre los inversionistas que respaldan a PrismML figuran Khosla Ventures, Cerberus Capital y Caltech.
Una ronda semilla de 22.25 millones de dólares
Aunque el laboratorio todavía no ha levantado grandes sumas de capital, sí cerró una ronda semilla de 22.25 millones de dólares. Para la compañía, el verdadero diferencial no está en el dinero, sino en las mentes técnicas que participan en el proyecto y en la tecnología potencialmente transformadora que está desarrollando.
El siguiente reto: modelos de varios cientos de miles de millones de parámetros
El próximo objetivo de la startup es aplicar esta técnica de compresión a modelos todavía más grandes. «Los próximos modelos que lanzaremos, con suerte en los próximos meses, estarán en el rango de varios cientos de miles de millones de parámetros, y espero que sea más fácil conservar la inteligencia allí», afirmó Hassibi.
Inteligencia artificial gratuita y privada en tus dispositivos
Para Ion Stoica, el entusiasmo pasa por lo que esta tecnología habilita: que modelos avanzados puedan ejecutarse directamente en los dispositivos de los usuarios. «Vas a tener inteligencia en la punta de tus dedos, y va a ser gratis porque correrá en el dispositivo que ya compraste. También va a ser privada, porque no la vas a enviar a la nube», señaló.

Los rumores sobre Apple
En el radar del sector también circula el rumor de que PrismML estaría en conversaciones con Apple, aunque Hassibi declinó hacer comentarios al respecto. Lo cierto es que la promesa de modelos de razonamiento diminutos, capaces de correr localmente sin depender de la nube, encaja de forma natural con la estrategia de los fabricantes de dispositivos.
No es la única empresa que comprime modelos de lenguaje
PrismML no es la única compañía que trabaja en tecnología de compresión de modelos LLM. Multiverse Computing, fundada por un reconocido profesor del Donostia International Physics Center de España, es otra de las firmas activas en este terreno. Sin embargo, Hassibi insiste en que el enfoque de PrismML es singular precisamente por la casi nula pérdida de rendimiento que reportan sus modelos comprimidos.
La carrera por llevar la inteligencia artificial de alto nivel fuera de los centros de datos ya está en marcha. Si los modelos de razonamiento logran vivir en tu computadora y en tu teléfono, el acceso a la IA cambiaría de raíz. Te invitamos a seguir de cerca las próximas entregas de PrismML, cuyos lanzamientos de mayor escala prometen llegar en los próximos meses.