En los últimos años, la competencia en inteligencia artificial ha tomado dos rutas paralelas. Por un lado, se han desarrollado modelos diminutos que pueden ejecutarse en dispositivos con recursos limitados, como smartphones o microcontroladores. China se ha consolidado como líder en este segmento gracias a familias como Qwen y MiniCPM, que optimizan el consumo de memoria y potencia sin sacrificar demasiado la precisión.
Sin embargo, la misma industria china está invirtiendo ahora en la otra cara de la moneda: modelos gigantescos que superan los billones de parámetros. DeepSeek‑V3 presentó 671 000 millones de parámetros, mientras que Moonshot AI lanzó Kimi K2 con un billón. En 2026, la escalada se intensificó; Kimi K3 alcanzó 2,8 billones y Alibaba posicionó a Qwen‑3.8‑Max en 2,4 billones. Estas cifras, aunque impresionantes, no indican que todos los parámetros se activen simultáneamente durante el procesamiento.
La clave está en arquitecturas como Mixture of Experts (MoE), que permiten activar solo una fracción de los parámetros en cada paso. Así lo demuestra Qwen‑3.8‑Max: aunque cuenta con 2,4 billones de parámetros, emplea alrededor de 95 000 millones por inferencia. Este enfoque, sospechado en GPT‑4 pero nunca confirmado por OpenAI, reduce drásticamente los requerimientos de cómputo sin perder capacidad.
El número de parámetros no es sinónimo de mejor desempeño. DeepMind lo mostró en 2022 con Chinchilla, que con 70 000 millones superó a Gopher de 280 000 en la mayoría de tareas, gracias a un entrenamiento con cuatro veces más datos y una arquitectura eficiente. Por ello, la calidad de los datos, la arquitectura y el presupuesto de cómputo siguen siendo factores decisivos.
Alibaba anunció el 22 de septiembre que Qwen 4 está en fase de entrenamiento y que su hoja de ruta contempla versiones de 5 a 10 billones de parámetros para Qwen 4.5 y Qwen 5. ByteDance también perseguiría escalas similares, según el Financial Times, aunque sin confirmación oficial. En contraste, compañías estadounidenses como OpenAI y Anthropic no revelan públicamente los tamaños de sus últimos modelos, dificultando comparaciones directas.
En conclusión, China no busca reemplazar los modelos pequeños por los gigantes, sino cubrir ambos extremos del espectro. Los modelos compactos son ideales para aplicaciones locales y de bajo costo, mientras que los colosales apuntan a tareas complejas que requieren una capacidad de razonamiento más amplia, aunque demanden infraestructuras masivas. Esta doble estrategia posiciona a China como un actor dominante tanto en IA de borde como en IA de gran escala.
Fuente: xataka