Xiaomi AI Cube: qué demuestra su prototipo de IA local
Xiaomi presentó AI Cube Prototype el 24 de agosto de 2026, un equipo de sobremesa pensado para ejecutar modelos grandes de IA en local. El diseño industrial entra por los ojos, pero lo relevante es la pila que hay dentro: procesador principal, acelerador de IA y chip de conducción propios, modelos MiMo y hasta 160 GB de memoria unificada.
También es un prototipo. Xiaomi no ha anunciado precio, fecha de venta, configuración final, sistema operativo, almacenamiento, puertos ni formatos de modelo compatibles. Es una dirección técnica, todavía no una recomendación de compra.
Lo que Xiaomi ha confirmado
El anuncio presenta tres chips XRing con funciones distintas:
* O3 es el SoC insignia de propósito general de Xiaomi. Integra CPU de 10 núcleos, GPU de 16 núcleos y una NPU de bajo consumo que Xiaomi cifra en 200 TOPS.
* O100 es un acelerador de IA de 6 nm para modelos en el dispositivo. Xiaomi afirma que su apilado 3D a nivel de oblea ofrece 1,22 TB/s de ancho de banda de computación cercana a memoria y que la pareja O3+O100 alcanza hasta 330 tokens por segundo.
* D100 es un chip de IA para automoción fabricado en 3 nm, con CPU de 20 núcleos, NPU de 16 núcleos y soporte para hasta 160 GB de memoria unificada. Según Xiaomi, puede alojar modelos de hasta 200.000 millones de parámetros.
La demostración de AI Cube ejecutó un modelo 120B junto a otro 3B, alternando entre un sistema rápido y otro lento. Xiaomi no ha identificado los modelos, la precisión numérica, la longitud de contexto, el tamaño de lote ni la velocidad observada para la carga 120B. Sin esos datos, la demostración es interesante, pero no comparable.
Por qué el ancho de banda importa más que los agujeros
Xiaomi ha mecanizado más de 33.874 perforaciones de refrigeración en la carcasa de aluminio. Es una imagen estupenda. Para la inferencia local, el número que importa es 1,22 TB/s.
La generación de tokens mueve los pesos del modelo por la memoria una y otra vez. Por eso la inferencia de modelos grandes suele chocar antes con el ancho de banda que con la capacidad de cálculo. O100 ataca ese cuello de botella con apilado de oblea sobre oblea e interconexiones cortas. Si la arquitectura cumple lo anunciado, podría dar mucha agilidad dentro de un consumo compacto.
Todavía no existe un benchmark reproducible. La cifra de 330 tokens por segundo no indica el modelo ni las condiciones de prueba. Un 3B a esa velocidad y un 120B a esa velocidad describen equipos radicalmente distintos. Hasta que Xiaomi publique la carga y terceros puedan repetirla, es una afirmación del fabricante.
La capacidad de memoria sí permite hacer una cuenta básica. Un modelo 120B necesita unos 120 GB solo para los pesos a 8 bits, antes de caché y sobrecarga del runtime, o unos 60 GB a 4 bits. Un espacio unificado de 160 GB deja margen creíble para modelos grandes cuantizados, pero hacer que quepan y servirlos bien son pruebas diferentes.
¿Un prototipo o varias configuraciones?
Las primeras noticias describen AI Cube como una única máquina de tres chips con O3, O100 y D100. El anuncio de Xiaomi es menos explícito. Primero habla de un prototipo de doble chip O3+O100 y después dice que D100 también se instaló en un AI Cube Prototype.
La redacción puede referirse a un sistema de tres chips, a distintas configuraciones de AI Cube o a una plataforma de ingeniería que ha ido cambiando. Xiaomi no ha publicado el diagrama de bloques que permitiría resolverlo. No conviene convertir una ambigüedad del día del lanzamiento en una especificación.
La distinción importa porque cada chip tiene un papel diferente. Los 1,22 TB/s pertenecen al acelerador O100. El máximo de 160 GB pertenece a la plataforma de automoción D100. Un titular que reúne la cifra más alta de cada chip no describe por sí solo una máquina comercial.
La capa que falta es el software
El hardware de IA local se convierte en plataforma cuando un equipo normal puede desplegar modelos sobre él. Xiaomi todavía no ha explicado el runtime, el compilador, los operadores compatibles, el empaquetado de modelos, la compatibilidad de API, la política de actualizaciones ni si los modelos abiertos habituales funcionarán sin convertirse a una pila propia.
Esa es la prueba estratégica. La ventaja de Nvidia no es solo el silicio. También son el software, las herramientas, la documentación y el conocimiento acumulado. Xiaomi controla dispositivos, HyperOS, los modelos MiMo y ahora una parte mayor del cálculo. AI Cube coloca esa integración vertical sobre una mesa. Aún no demuestra que un desarrollador externo pueda aprovecharla.
Para las empresas, la señal va más allá de esta caja. Los servidores de IA local están pasando del rack a equipos de oficina con memoria unificada y enrutado entre modelos pequeños y grandes. Eso puede reducir latencia, mantener los prompts sensibles dentro de la empresa y hacer el gasto más predecible. También devuelve al propietario la responsabilidad sobre seguridad, actualizaciones, observabilidad y capacidad.
No esperes a un prototipo si la necesidad existe hoy, ni compres el hardware de hoy por una diapositiva de mañana. Empieza por la carga, el límite del dato, la concurrencia y las pruebas de aceptación. Después compara sistemas que se puedan comprar y mantener. Nuestra guía de hardware para IA on-premise enseña la cuenta, y una consultoría de IA acotada puede convertirla en una decisión de despliegue.
---
Fuentes: anuncio de Lei Jun reproducido por HSTong · cobertura de IT Home desde el evento. Las especificaciones y cifras de rendimiento son afirmaciones del fabricante o del evento, no mediciones independientes.