kimi k3 moe mezcla de expertos shorts
Ver en YouTube En la práctica, por cada cálculo están activos unos cincuenta mil millones de parámetros, no dos punto ocho billones. Mezcla de expertos. La arquitectura MoE que ya popularizó Mistral, que luego adoptó DeepSeek, y ahora Moonshot. Básicamente, el modelo es enorme en papel pero ligero en ejecución. Exactamente. Y aquí es
En la práctica, por cada cálculo están activos unos cincuenta mil millones de parámetros, no dos punto ocho billones. Mezcla de expertos. La arquitectura MoE que ya popularizó Mistral, que luego adoptó DeepSeek, y ahora Moonshot. Básicamente, el modelo es enorme en papel pero ligero en ejecución. Exactamente. Y aquí es donde Moonshot hace algo que vale la pena entender: no están compitiendo en bruta potencia de cómputo, porque no pueden. Las restricciones de exportación de chips de Nvidia a China les cierran el acceso a las últimas GPUs de entrenamiento. Entonces apuestan por innovación arquitectónica. Y no es la primera vez que vemos eso.
Episodio completo: https://youtu.be/kWzw1qh8nHw
🤖 Contenido generado con IA: el guion, las voces y las imágenes de este episodio se produjeron con herramientas de inteligencia artificial.
#Shorts