ARM CSS for Mobile 2: La apuesta por la IA agéntica con doble motor SME2 y núcleos C2-Ultra
por Antonio DelgadoARM CSS for Mobile 2: Nueva arquitectura para SoCs móviles centrada en la IA agéntica
ARM ha celebrado su evento para mostrarnos sus novedades de cara a la nueva generación de procesadores basados en su arquitectura. Tras el lanzamiento el año pasado de la plataforma Lumex y el abandono de los núcleos Cortex para pasar a los ARM C1, ahora la compañía ha desvelado su nueva plataforma ARM CSS for Mobile 2 para dar vida a la próxima generación de SoCs para dispositivos móviles.
Podemos ver que la compañía ha prescindido del nombre de "Lumex", solo utilizado en la pasada generación, y ha vuelto a la nomenclatura CSS ya asentada entre clientes y el mercado.

En esta ocasión, ARM se ha centrado sobre todo en optimizar el hardware para la "IA agéntica" (sistemas de IA que trabajan de fondo de forma continua para planificar y ejecutar acciones por sí mismas sin el típico esquema de "orden/respuesta" de la IA tradicional), una tecnología donde la CPU vuelve a retomar cierto protagonismo.
A lo largo de este artículo conoceremos qué nos ofrecerán a nivel de arquitectura y prestaciones los nuevos núcleos C2-Ultra, C2-Premium y C2-Pro, junto con las novedades del nuevo sistema de interconexión SI L2, el soporte para memoria LPDDR6 y el clúster con doble motor SME2. Todo ello englobado en la nueva plataforma CSS for Mobile 2.
La compañía también ha desvelado su nueva arquitectura de GPU Mali G2-Ultra NX con aceleradores neuronales, pero a ella le dedicaremos otro artículo más en detalle.

Plataforma CSS for Mobile 2: Interconexión SI L2 y soporte para LPDDR6
La plataforma ARM CSS for Mobile 2 está formada por distintos elementos, donde los más importantes suelen ser la parte de CPU y GPU, pero nada de eso funcionaría sin un conjunto de elementos y tecnologías que lo unifique a todo.

Sistema de Interconexión SI L2
De hecho, uno de los cambios más importantes de CSS 2 lo encontramos en su nuevo sistema de interconexión SI L2 (System Interconnect L2), un subsistema que sustituye al anterior SI L1 y que llega con un diseño específico para optimizar la comunicación en procesos de IA.
SI L2 está diseñado específicamente para plataformas móviles y promete reducir la latencia y aumentar el ancho de banda de la comunicación interior del SoC.

En el diagrama de bloques de la plataforma CSS for Mobile 2 podemos ver de manera más visual la función del SI L2.
El SI L2 conecta el módulo DSU o "cluster" de CPU mediante enlaces CHI (Coherent Hub Interface) y la GPU con interfaces AXI y a través de MMU-L1 (unidad de gestión de memoria) dedicadas (tanto para la GPU como para dispositivos externos).
Todo el SoC comparte una memoria caché SLC de 16 MB, igual que la plataforma anterior, pero en vez de ser un único diseño monolítico, se divide en varios nodos MCN dentro de cada canal de memoria. De esta manera, la CPU y la GPU se pueden comunicar entre sí sin bloquearse entre sí.

Este nuevo diseño permite, según la compañía, reducir hasta en un 45% la latencia entre la CPU y la memoria DRAM, especialmente en tareas de IA agénticas donde se necesite acceder a datos directamente.
Dado que tanto la CPU con sus motores SME2 como la GPU Mali G2-Ultra NX comparten el acceso a la memoria unificada, ARM ha integrado un sistema QoS (calidad de servicio) para que se gestione el acceso a la memoria de forma dinámica. De esta manera, un proceso de una tarea muy pesada no debería nunca saturar la memoria y así no limitar el acceso a otras tareas más urgentes y cortas de la CPU

Soporte nativo para LPDDR6 y listo para 2 nanómetros
En cuanto a la compatibilidad con memoria RAM, el controlador de memoria de la plataforma da el salto a la nueva LPDDR6 de manera nativa.
El nuevo controlador soporta cuatro canales de 24 bits con memorias LPDDR6 a 12.800 MT/s para un ancho de banda de 136 GB/s, una mejora considerable desde el soporte LPDDR5X-9600 en cuatro canales de 16 bits con un límite de 76,8 GB/s de la plataforma anterior. Hablamos de una mejora del 77% en ancho de banda.
Estos diseños de referencia de ARM se podrán ver posiblemente en chips fabricados en nodos de 2 nanómetros, aunque, tal y como nos han comentado desde la compañía, se trata de una arquitectura multiproceso que puede adaptarse a distintos métodos de fabricación.
Plataformas de software ARM AI Portal y Kleidi AI
La plataforma CSS for mobile 2 llega acompañada también de su parte de software con KleidiAI y AI Portal para poder sacarle todo el provecho al hardware.
KleidiAI ofrece distintas librerías de código con optimizaciones para las instrucciones vectoriales y matriciales de ARM. Incluyen soporte para los entornos más utilizados como PyTorch, TensorFlow, ONNX Runtime, etc, de tal manera que se puede aprovechar en hardware en plataformas ya existentes, incluyendo motores gráficos como Unity y Unreal Engine.

Por otro lado, el Arm AI Portal funciona como un repositorio donde ARM ofrece modelos de IA (lenguaje, visión y voz) ya optimizados para la plataforma en formatos ligeros para smartphones como INT4 e INT2.

Nuevos núcleos ARM C2: Doble motor SME2 para IA local y hasta 4,45 GHz en el C2-Ultra
La nueva plataforma CSS 2 for Mobile de ARM incluye los nuevos núcleos ARM C2 para suceder a los actuales C1 con distintas mejoras. Se mantendrán distintas variantes dependiendo de su rendimiento y consumo, siendo los modelos más capaces los ARM C2-Ultra y C2 Premium, seguidos de los C2-Pro y C2-Nano. Todo ello con el sistema de interconexión DSU con 3 MB de caché L3 compartida.

En el diseño de ejemplo y referencia que ha mostrado ARM; tenemos un diseño con dos núcleos ARM C2-Ultra de máximo rendimiento, junto a seis núcleos ARM C2-Pro de mayor eficiencia. Dependerá de cada compañía el escoger los distintos núcleos que formen su chip.

Por ejemplo, se podrán crear chips de bajo consumo y prestaciones con solamente dos núcleos C2-Nano, modelos intermedios con núcleos Premium, Pro y nano, y las variantes más potentes con Ultra y Pro.

IA local: Doble motor SME2 C1 y soporte para Lookup Tables (LUTi)
Al ser una arquitectura donde se ha destacado considerablemente su enfoque hacia la IA agéntica, ARM ha priorizado el uso de IA en CPU, de hecho, esta plataforma no sienta las bases para la implementación de ninguna NPU propia de ARM. En la IA agéntica, la compañía destaca que la CPU es clave.
Como ya vimos en la pasada generación, ARM ha apostado por la integración de las instrucciones SME2 en lugar de depender exclusivamente de una NPU externa para tareas de IA en Local.
Respecto de la pasada generación, la plataforma CSS for Mobile 2 integra ahora dos motores de aceleración SME2 funcionando a 3,0 GHz, uno más (el doble) que CSS1. No obstante, se trata de dos motores SME2 de la arquitectura C1 anterior, no son una versión C2 nueva, y toda la mejora de rendimiento a la que hace referencia ARM se limita a duplicar ese número de motores y conseguir una velocidad de funcionamiento más alta.

También añade soporte para las instrucciones LUTi (Lookup Table) para la aceleración de modelos INT4 y de 2 bits. Básicamente, esto permite la consulta de tablas en el núcleo, evitando el acceso a la memoria interna, y reduciendo así las necesidades de ancho de banda.

En entornos de uso de IA local en móviles, según ARM, estas mejoras consiguen que, por ejemplo, pasar voz a texto sea un 40% más rápido, reducir la latencia de búsqueda un 41% y acelerar el tiempo de la primera respuesta de los modelosen un 25%.

De media, completar una tarea con agentes es un 24% más rápido, reduciendo el tiempo total en unos 450 milisegundos respecto de la plataforma anterior.
Eso sí, hay que comentar que, al igual que en la pasada generación, se podrán crear chips sin DSU y, por tanto, sin motores SME2, para aquellas aplicaciones donde no sea necesario.
Núcleos ARM C2-Ultra: 15% más de rendimiento y hasta 4,45 GHz
Los núcleos ARM C2-Ultra suponen la gama más alta con mayor rendimiento y consumo. En concreto, prometen un 15% más de rendimiento en un hilo en Geekbench 6 comparados con los C1-Ultra.

Este aumento de rendimiento depende de varios elementos, por ejemplo, solo un 7% se debe a la mejora de IPC de la arquitectura. El 8% restante se consigue por el aumento de frecuencias que acompañarán a estos núcleos.
Hablamos de velocidades máximas de 4,45 GHz frente a los 4,10 GHz de la pasada generación.

Para ello, se ha mejorado la arquitectura en el frontend y el backend. Se ha reducido hasta en un 16% los fallos en la predicción de saltos a "ventana de ejecución fuera de orden" para detectar operaciones independientes. A nivel de memoria, la caché L2 privada crece hasta los 3 MB y los precargadores de datos son más eficaces, consiguiendo una reducción del 90% en los bloqueos. Al mismo rendimiento, estos núcleos prometen consumir un 38% menos de energía.

El rendimiento pico de IA promete mejoras de hasta el 70% respecto de la pasada generación C1-Ultra con un motor de SME2.

ARM C2-Premium y C2-Pro
Un paso por debajo de los C2-Ultra tenemos los núcleos C2-Premium, con un tamaño más contenido al recortar la caché L2 y las unidades vectoriales frente al modelo Ultra. Tienen en torno a un 15% menos de potencia, pero ocupan menos espacio y consume menos.
Por su parte, los núcleos C2-Pro serán los encargados de combinar rendimiento con potencia multinúcleo de manera sostenida. Cuentan con 1 MB de caché L2 y operan a 3,60 GHz. En configuraciones multinúcleo, el SoC con estos C2 mejora de media un 12% su rendimiento en Geekbench y otro 12% en velocidad de apertura de apps.
La GPU Mali G2-Ultra NX también trae novedades interesantes y su propia aceleración de IA que repasaremos en su propio artículo.
Fin del Artículo. ¡Cuéntanos algo en los Comentarios!




