El chip AMD MI450 personalizado de Meta tiene la mitad de potencia y mucha menos memoria; SemiAnalysis: esto es una tristeza de la cultura empresarial de Meta
¡Miles de millones de dólares perdidos! Meta ha cometido errores “catastróficos” en infraestructura de IA: obligó a AMD a recortar su chip más potente y una adquisición de 2.5 mil millones terminó en desastre. Las instituciones critican fuertemente: la cultura de desempeño miope y la excesiva personalización están matando la colaboración entre software y hardware. Esta profunda crisis organizacional está costándole caro a Meta.
Meta está exponiendo los problemas profundos de su cultura organizacional a un costo de miles de millones de dólares, producto de una serie de errores de decisión en el ámbito de infraestructura de IA.
Según la última revelación de SemiAnalysis, una institución de investigación de la industria de chips, Meta está solicitando a AMD que le fabrique una versión personalizada del chip MI450X con especificaciones notablemente reducidas: unidades de cómputo a la mitad, el apilado de memoria HBM disminuido de 12 capas a 8, y la capacidad de memoria reducida en casi dos tercios. SemiAnalysis califica directamente esta decisión como “catastrófica” y hace un llamado público para que AMD evite al equipo de infraestructura de Meta, y en cambio se relacione directamente con TBD Lab, el laboratorio de superinteligencia de Meta, impulsando la adquisición de la versión estándar del MI450X.
Este evento no es aislado. SemiAnalysis señala que, desde la adquisición de Rivos por más de 2.500 millones de dólares, pasando por los servidores personalizados H100 Grand Teton, hasta el esquema customizado GB200 Ariel, el equipo de infraestructura de Meta demuestra un patrón consistente de sobreingeniería, falta de diseño colaborativo entre hardware y software, y una preferencia por objetivos políticos de corto plazo sobre racionalidades técnicas de largo plazo. “El equipo de infraestructura de Meta necesita un reinicio cultural”, escribe SemiAnalysis.

El chip más poderoso de AMD recibe un “recorte”, afectando gravemente el rendimiento GenAI
El AMD MI450X es actualmente uno de los GPU más agresivos en especificaciones de ingeniería de silicio: tecnología de fabricación de 2 nanómetros, encapsulado con bonding híbrido, apilado de memoria HBM4 de 12 capas y el tamaño de fotomáscara CoWoS más grande del mercado, representando el límite superior de densidad de encapsulado y almacenamiento. 
Sin embargo, de acuerdo con SemiAnalysis, la versión personalizada que Meta ha solicitado reduce a la mitad el área de silicio de cómputo y baja el apilado HBM de 12-Hi a 8-Hi, lo que implica una compresión simultánea del poder de cómputo y el ancho de banda de memoria, ambos indicadores clave. El equipo de infraestructura de Meta argumenta que esta configuración está orientada a cargas de trabajo de sistemas de recomendación (RecSys), con el objetivo de aumentar la proporción de procesamiento CPU contra GPU.
El problema es que esta decisión fue tomada antes de la creación de TBD Lab, el equipo central de investigación de modelos grandes de Meta, quien no muestra interés alguno en este chip. SemiAnalysis señala claramente que, comparado con el Vera Rubin de Nvidia, el MI450 recortado no resulta atractivo para TBD Lab, “TBD se inclinará fuertemente por Rubin”. Esto significa que la cantidad de chips AMD despachados a Meta se verá gravemente afectada por esta decisión.
SemiAnalysis, en su informe, de manera poco habitual, le habla directamente a AMD: “AMD debe intervenir y colaborar directamente con el equipo de TBD, asegurando que reciban la versión estándar del MI450, y no esta versión recortada que no tiene valor para GenAI”.
La compra de Rivos: más de 2.500 millones de dólares para un resultado caótico
Otro caso típico de errores en decisiones de infraestructura por parte de Meta es la compra de Rivos, completada en 2024 por más de 2.500 millones de dólares.
Según SemiAnalysis, dentro del área de chips de Meta pocos entienden la lógica estratégica detrás de la compra, y quienes impulsaron originariamente la operación ahora mantienen silencio. La visión predominante: Meta tiene liquidez, el sector de chips personalizados está en auge y, ante la previa autorización de uso de propiedad intelectual de Rivos, la gerencia pensó mejor adquirir la compañía completa.
Pero la estructura misma de la negociación trajo problemas. El equipo fundador de Rivos exigió la venta agrupada de todo el equipo, obligando a Meta a comprar la compañía entera para luego recortar drásticamente áreas no deseadas. El reporte cita ex empleados de chips de Meta, señalando que la compra estuvo liderada por Yee Jiun Song, responsable de silicio en Meta, quien enfrentó oposiciones internas pero perdió interés luego de concluir la transacción. Los actuales gestores integraron a los ingenieros de Rivos como “mano de obra gratuita” a sus equipos, desintegrando la estructura original de Rivos en poco tiempo.
En términos técnicos, el valor clave de la adquisición —la propiedad intelectual GPU SIMT de Rivos— quedó anulada tras la cancelación del proyecto “Olympus” que iba a emplear esta tecnología. La alternativa, el proyecto “Phoebe”, prevé el tapeout para 2028 como pronto, aunque SemiAnalysis indica que internamente hay dudas sobre su viabilidad.
La pérdida de talento también es alarmante. De acuerdo a SemiAnalysis, alrededor del 30% de los empleados de Rivos han dejado la empresa tras los recientes despidos, el cofundador Mark Hayter ya se fue, y varios ex empleados de Rivos migraron a la startup de chips fundada por Gerard Williams, Nuvacore, tras el vesting de sus RSU en mayo de este año. Además, SemiAnalysis revela que Puneet Kumar, CEO y cofundador de Rivos, posiblemente dejará Meta uno o dos años después del vesting completo de sus acciones.
Grand Teton y Ariel: costes reiterados de diseño
La obsesión por la personalización en Meta no es nueva. Su servidor personalizado H100, Grand Teton, añadió sobre el servidor estándar HGX una bandeja de switches extra, con cuatro switches PCIe Broadcom, 16 SSD y ocho tarjetas de red, para dotar a cada servidor de almacenamiento directo para guardar puntos de control de entrenamiento.
Pero tras la entrada en producción, el uso real del almacenamiento por los equipos de modelado fue muy inferior a lo esperado, y el diseño terminó descartado. SemiAnalysis apunta que esto demuestra la falta de diseño colaborativo entre equipos de hardware y software en Meta: el equipo de infraestructura incurrió en mayores costes y consumo por funciones poco utilizadas, aumentando además la dependencia de Broadcom, lo contrario al objetivo inicial de reducir dependencia de soluciones de red de Nvidia.
Con la llegada de la era Blackwell, Meta siguió patrones similares con el diseño “Ariel”. La especificación estándar del GB200 prevé cada CPU Grace acompañada por dos GPU B200, pero Ariel lo alteró a una configuración uno a uno, reduciendo a la mitad la cantidad de GPU. El motivo: aumentar el ratio de CPU para cargas de RecSys.

Según cálculos de SemiAnalysis, el TCO (coste total de propiedad) del esquema Ariel NVL36x2 supera en un 14% al estándar GB200 NVL72, y los recursos extra en CPU y DRAM, justamente, no son requeridos por los equipos de modelos grandes. Para compensar la menor cantidad de GPU y la brecha de interconexión, se emplearon conexiones entre racks, lo que trajo problemas de latencia y fiabilidad. Al mismo tiempo, el backplane NVL72, antes considerado inestable, ahora ha madurado, demostrando que Meta evaluó esos riesgos de forma incorrecta.
SemiAnalysis indica que los servidores GB300 de Meta han vuelto a la configuración estándar, lo que constituye en sí mismo una negación del diseño Ariel.
Raíz cultural: los objetivos de corto plazo superan la estrategia de largo plazo
SemiAnalysis atribuye estos problemas a la cultura organizacional del equipo de infraestructura en Meta.
La institución señala que, el ciclo de evaluación de desempeño cada seis meses en Meta elimina al 10-15% de los empleados con menor rendimiento en cada ronda, llevando a los equipos a buscar resultados visibles a corto plazo, en detrimento de la planificación tecnológica de largo plazo. Algunos líderes impulsan proyectos con alto perfil mediático y de rápida entrega, cambiando de rumbo luego de concluirlos. Esta práctica se conoce internamente como “window washing”. Además, pocos desafían públicamente las decisiones de superiores, imposibilitando la corrección temprana de errores.
El equipo de cadena de suministro tiene poca influencia en las decisiones de ingeniería, lo que amplifica los problemas señalados. SemiAnalysis indica que algunos proveedores ya han disminuido la prioridad de nuevos proyectos de Meta por sus frecuentes cambios, favoreciendo demandas de Amazon o Google.
SemiAnalysis compara este fenómeno con la trayectoria de expansión de Reality Labs de Meta, donde antes de los recortes masivos, se invirtieron miles de millones en grandes equipos de ingeniería y proyectos de R&D. Ahora, al empezar a vender capacidad de cómputo a clientes externos, el coste de esta cultura interna se hará más evidente en el mercado.
Descargo de responsabilidad: El contenido de este artículo refleja únicamente la opinión del autor y no representa en modo alguno a la plataforma. Este artículo no se pretende servir de referencia para tomar decisiones de inversión.
También te puede gustar
Noche clave de resultados financieros de Google, ¿se espera un aumento en la guía de Capex? Analista senior: podría alcanzar los 200 mil millones de dólares en 2026
Robert Castellano, un analista tecnológico con más de 40 años de experiencia, señaló que la guía anterior de Alphabet sobre el Capex para 2026, entre 180 mil y 190 mil millones de dólares, era demasiado conservadora, y se espera que en este informe financiero se revise al alza, ubicándose entre 190 mil y 200 mil millones de dólares. Deutsche Bank también incrementó considerablemente su pronóstico, estimando que el Capex llegará a 325 mil millones de dólares en 2027 (anteriormente 250 mil millones), y para 2028, se ubicará entre 365 mil y 370 mil millones de dólares.
Divergencia tipo K, ¿cuándo convergerán? [Dapeng habla - Lección 4]
![Divergencia tipo K, ¿cuándo convergerán? [Dapeng habla - Lección 4]](https://img.bgstatic.com/spider-data/bc2765640f036af904832aec2bd97d5a1784714811656.png?w=420&h=236&f=webp)
Estados Unidos planea imponer nuevos aranceles antes del viernes, dando continuidad al arancel temporal global del 10% que está por vencer.
El presidente de Estados Unidos, Donald Trump, se prepara para imponer nuevos aranceles a productos de decenas de economías antes del viernes.

