Kog: la startup que quiere exprimir al máximo la inferencia de IA en GPUs convencionales

Kog: la startup que quiere exprimir al máximo la inferencia de IA en GPUs convencionales

La carrera por una inferencia de IA más rápida no se detiene. Mientras que Cerebras recibía una cálida bienvenida del mercado en su debut bursátil en mayo con sus chips diseñados a propósito, la startup francesa Kog apuesta por una vía diferente: sacar mucho más rendimiento a las GPUs convencionales mediante optimización por software. A continuación, te contamos cómo Kog planea lograrlo y por qué su enfoque está llamando la atención.

En mayo, Kog llegó a la portada de Hacker News con una prueba técnica que buscaba demostrar que “la decodificación de solicitudes extremadamente rápida es posible en las GPUs de centro de datos estándar que las empresas ya poseen”, como las AMD MI300X y Nvidia H200 que utilizó en su demo.

“La decodificación de solicitudes extremadamente rápida es posible en las GPUs de centro de datos estándar que las empresas ya poseen”.

Una prueba que despertó interés y críticas

Algunos lamentaron que la promesa no llegara también a las GPUs de las laptops, pero otros vieron el potencial. Con la velocidad y el costo de inferencia convertidos en un cuello de botella crítico, la propuesta de Kog de desbloquear nuevas capacidades en hardware existente atrajo más que simples miradas. “Tuvimos 200 leads comerciales tangibles”, afirmó el CEO de Kog, Gaël Delalleau.

  • Enfoque: Optimización por software para GPUs estándar de centro de datos.
  • Hardware del demo: AMD MI300X y Nvidia H200.
  • Rendimiento: 3,000 tokens por segundo (TPS) por solicitud.
  • Modelo usado: Laneformer 2B, un modelo pequeño de unos 2 mil millones de parámetros, ahora de código abierto.
Gráfico comparativo de velocidad de inferencia de Kog frente a otros motores y APIs
El gráfico de Kog muestra un rendimiento de 3,080 TPS en la prueba técnica de mayo, muy por encima de otros motores de inferencia.

Primeros casos de uso: de la ingeniería de software a los juegos

Según los primeros comentarios de los clientes, Delalleau espera que la ingeniería de software sea el primer caso de uso. Los usuarios veteranos de Claude Code saben bien que a veces deben esperar horas para obtener resultados. La propia Anthropic entiende que la velocidad vale dinero y cobra un precio superior por el modo rápido de Claude, conocido como Claude Fast Mode.

Kog pretende atraer a clientes que se sienten frenados por esas demoras, normalmente porque dependen de flujos de trabajo de IA para tareas profesionales. Además, la startup trabaja con socios de diseño que permiten a los usuarios generar juegos y aplicaciones a partir de un prompt; para ellos, un resultado más rápido gracias al Kog Inference Engine (KIE) significaría más ingresos.

Un mercado que aún está madurando

Kog es consciente de que este mercado no está del todo maduro. Al observar la demanda, aprendió que sus posibles clientes no están preparados para hacer fine-tuning de modelos pequeños. “Desde el lanzamiento, nos hemos centrado por completo en acelerar el desarrollo de modelos más grandes para satisfacer la demanda que hemos visto”, explicó Delalleau.

El gran reto: llevar la optimización a los LLM

Kog tiene por delante un gran salto para cumplir su promesa de inferencia LLM 30 veces más rápida. Su demo mostró unos impresionantes 3,000 tokens por segundo (TPS) por solicitud, pero con un modelo pequeño diseñado a propósito, de solo unos 2 mil millones de parámetros, el ahora open source Laneformer 2B.

Frente a los escépticos, Delalleau se muestra confiado en que el mismo enfoque puede funcionar con modelos de lenguaje de gran tamaño, cuyo tamaño puede ser un desafío para los chips de inferencia. “Las GPUs tienen un futuro brillante”, dijo. Para el CEO, la idea de que las GPUs no son adecuadas para la decodificación se ha convertido en un concepto erróneo: las GPUs más nuevas tienen cada vez más ancho de banda de memoria que pide ser aprovechado.

Una mezcla de física, hacking e ingeniería profunda

Kog no es la única que cree que la optimización por software puede ayudar a las GPUs a ir más allá de lo que promete la etiqueta. La también francesa ZML lanzó un software independiente del hardware que evita el CUDA de Nvidia para soportar inferencia rápida en chips de la competencia. No obstante, Delalleau señala que Kog se parece más al laboratorio Hazy Research de la Universidad de Stanford, con un enfoque aún más profundo en la aceleración de GPUs.

El propio Delalleau no es investigador y su primera startup, Stribe, de 2009, nada tiene que ver con Kog, salvo por su ex cofundador convertido en venture capitalist, Kamel Zeroual, cuya firma Varsity VC co-lideró la ronda semilla de Kog. Su enfoque profundo nace de una formación peculiar: estudió física del estado sólido en la École Polytechnique de Francia y luego trabajó en ciberseguridad ofensiva, conocida también como hacking de sombrero blanco.

“Existe esta mentalidad de entender las leyes de la física y las leyes de la GPU para aprovecharlas al máximo”.

En cuanto al hacking, el cuatro veces finalista del torneo CTF de DEFCON explicó que le enseñó “a hacer reverse engineering a un nivel muy bajo, hasta el lenguaje ensamblador y el código binario”, para entender cómo funciona un sistema y usarlo con un objetivo para el que no fue diseñado originalmente.

Un trabajo profundo que requiere tiempo

La desventaja de este enfoque es que es muy práctico y requiere mucho tiempo. “Para cada nueva GPU, dedicaremos varias semanas o incluso meses a profundizar en los detalles y realizar investigación de ingeniería GPU en ese hardware”, señaló Delalleau. Con un equipo de 11 personas, esto pone un límite a la cantidad de chips con los que Kog puede trabajar, al menos en el futuro previsible.

Próximos pasos: modelos grandes, soberanía y Serie A

A largo plazo, Kog espera integrar su metodología en pipelines basados en agentes que le permitan soportar más chips y modelos. Mientras Europa busca construir su propia capacidad en ambos frentes, esto podría dar vientos de cola de soberanía a la startup, que ya cuenta con Scaleway como apoyo y con el respaldo de Bpifrance y del programa French Tech 2030.

Por ahora, Kog necesita demostrar que su enfoque funciona en LLMs. Eso también será clave para conseguir más financiación. “Una vez que hayamos implementado nuestro primer modelo importante a 10x de velocidad, lo que creo que será en septiembre, podremos empezar a demostrar tracción de clientes y, a partir de ahí, levantar nuestra Serie A”, concluyó Delalleau.

Comparte este artículo

Otras notas de tu interés:

Economia

Miami ordena cesar los alquileres vacacionales ilegales de Airbnb en The Club at Brickell Bay

Politica

Republicanos atacan a demócratas llamándolos veganos en la campaña electoral de EE.UU.

Noticia Local

Miami Spice 2026: los mejores restaurantes asiáticos para cenar

Negocios

Allen Morris Brickell Park: la reurbanización que enciende el debate por los espacios verdes en Miami

Economia

Donaciones de B&B Professional Consultants: el peso político de Barbara Hardemon en Miami-Dade

Politica

El Congreso de EE. UU. en redes sociales: así se miden sus grandes estrellas digitales

Economia

Miami ordena el cese inmediato de los alquileres vacacionales en The Club at Brickell Bay

Economia

Writer lanza Palmyra X6: el modelo de IA que reduce hasta 50% los costos de tokens

Economia

Databricks recauda $5,000 millones y alcanza una valuación de $190,000 millones

Economia

IBM y OpenAI sellan una alianza estratégica para la consultoría de IA empresarial