Kog: la startup que quiere exprimir al máximo la inferencia de IA en GPUs convencionales
La carrera por una inferencia de IA más rápida no se detiene. Mientras que Cerebras recibía una cálida bienvenida del mercado en su debut bursátil en mayo con sus chips diseñados a propósito, la startup francesa Kog apuesta por una vía diferente: sacar mucho más rendimiento a las GPUs convencionales mediante optimización por software. A continuación, te contamos cómo Kog planea lograrlo y por qué su enfoque está llamando la atención.
En mayo, Kog llegó a la portada de Hacker News con una prueba técnica que buscaba demostrar que “la decodificación de solicitudes extremadamente rápida es posible en las GPUs de centro de datos estándar que las empresas ya poseen”, como las AMD MI300X y Nvidia H200 que utilizó en su demo.
“La decodificación de solicitudes extremadamente rápida es posible en las GPUs de centro de datos estándar que las empresas ya poseen”.
Una prueba que despertó interés y críticas
Algunos lamentaron que la promesa no llegara también a las GPUs de las laptops, pero otros vieron el potencial. Con la velocidad y el costo de inferencia convertidos en un cuello de botella crítico, la propuesta de Kog de desbloquear nuevas capacidades en hardware existente atrajo más que simples miradas. “Tuvimos 200 leads comerciales tangibles”, afirmó el CEO de Kog, Gaël Delalleau.
- Enfoque: Optimización por software para GPUs estándar de centro de datos.
- Hardware del demo: AMD MI300X y Nvidia H200.
- Rendimiento: 3,000 tokens por segundo (TPS) por solicitud.
- Modelo usado: Laneformer 2B, un modelo pequeño de unos 2 mil millones de parámetros, ahora de código abierto.

Primeros casos de uso: de la ingeniería de software a los juegos
Según los primeros comentarios de los clientes, Delalleau espera que la ingeniería de software sea el primer caso de uso. Los usuarios veteranos de Claude Code saben bien que a veces deben esperar horas para obtener resultados. La propia Anthropic entiende que la velocidad vale dinero y cobra un precio superior por el modo rápido de Claude, conocido como Claude Fast Mode.
Kog pretende atraer a clientes que se sienten frenados por esas demoras, normalmente porque dependen de flujos de trabajo de IA para tareas profesionales. Además, la startup trabaja con socios de diseño que permiten a los usuarios generar juegos y aplicaciones a partir de un prompt; para ellos, un resultado más rápido gracias al Kog Inference Engine (KIE) significaría más ingresos.
Un mercado que aún está madurando
Kog es consciente de que este mercado no está del todo maduro. Al observar la demanda, aprendió que sus posibles clientes no están preparados para hacer fine-tuning de modelos pequeños. “Desde el lanzamiento, nos hemos centrado por completo en acelerar el desarrollo de modelos más grandes para satisfacer la demanda que hemos visto”, explicó Delalleau.
El gran reto: llevar la optimización a los LLM
Kog tiene por delante un gran salto para cumplir su promesa de inferencia LLM 30 veces más rápida. Su demo mostró unos impresionantes 3,000 tokens por segundo (TPS) por solicitud, pero con un modelo pequeño diseñado a propósito, de solo unos 2 mil millones de parámetros, el ahora open source Laneformer 2B.
Frente a los escépticos, Delalleau se muestra confiado en que el mismo enfoque puede funcionar con modelos de lenguaje de gran tamaño, cuyo tamaño puede ser un desafío para los chips de inferencia. “Las GPUs tienen un futuro brillante”, dijo. Para el CEO, la idea de que las GPUs no son adecuadas para la decodificación se ha convertido en un concepto erróneo: las GPUs más nuevas tienen cada vez más ancho de banda de memoria que pide ser aprovechado.
Una mezcla de física, hacking e ingeniería profunda
Kog no es la única que cree que la optimización por software puede ayudar a las GPUs a ir más allá de lo que promete la etiqueta. La también francesa ZML lanzó un software independiente del hardware que evita el CUDA de Nvidia para soportar inferencia rápida en chips de la competencia. No obstante, Delalleau señala que Kog se parece más al laboratorio Hazy Research de la Universidad de Stanford, con un enfoque aún más profundo en la aceleración de GPUs.
El propio Delalleau no es investigador y su primera startup, Stribe, de 2009, nada tiene que ver con Kog, salvo por su ex cofundador convertido en venture capitalist, Kamel Zeroual, cuya firma Varsity VC co-lideró la ronda semilla de Kog. Su enfoque profundo nace de una formación peculiar: estudió física del estado sólido en la École Polytechnique de Francia y luego trabajó en ciberseguridad ofensiva, conocida también como hacking de sombrero blanco.
“Existe esta mentalidad de entender las leyes de la física y las leyes de la GPU para aprovecharlas al máximo”.
En cuanto al hacking, el cuatro veces finalista del torneo CTF de DEFCON explicó que le enseñó “a hacer reverse engineering a un nivel muy bajo, hasta el lenguaje ensamblador y el código binario”, para entender cómo funciona un sistema y usarlo con un objetivo para el que no fue diseñado originalmente.
Un trabajo profundo que requiere tiempo
La desventaja de este enfoque es que es muy práctico y requiere mucho tiempo. “Para cada nueva GPU, dedicaremos varias semanas o incluso meses a profundizar en los detalles y realizar investigación de ingeniería GPU en ese hardware”, señaló Delalleau. Con un equipo de 11 personas, esto pone un límite a la cantidad de chips con los que Kog puede trabajar, al menos en el futuro previsible.
Próximos pasos: modelos grandes, soberanía y Serie A
A largo plazo, Kog espera integrar su metodología en pipelines basados en agentes que le permitan soportar más chips y modelos. Mientras Europa busca construir su propia capacidad en ambos frentes, esto podría dar vientos de cola de soberanía a la startup, que ya cuenta con Scaleway como apoyo y con el respaldo de Bpifrance y del programa French Tech 2030.
Por ahora, Kog necesita demostrar que su enfoque funciona en LLMs. Eso también será clave para conseguir más financiación. “Una vez que hayamos implementado nuestro primer modelo importante a 10x de velocidad, lo que creo que será en septiembre, podremos empezar a demostrar tracción de clientes y, a partir de ahí, levantar nuestra Serie A”, concluyó Delalleau.