Google, de Alphabet, está trabajando en una nueva iniciativa para mejorar la ejecución de sus chips de inteligencia artificial (IA) en PyTorch, el framework de software de IA más utilizado del mundo, con el objetivo de debilitar el dominio que Nvidia mantuvo durante mucho tiempo en el mercado de la computación de IA, indican fuentes cercanas al tema.
Esta iniciativa forma parte del ambicioso plan de Google para convertir sus Unidades de Procesamiento Tensor en una alternativa viable a las GPU de Nvidia, líderes del mercado. Las ventas de TPU se convirtieron en un motor de crecimiento crucial para los ingresos de Google en la nube, ya que busca demostrar a los inversores que sus inversiones en IA están generando rentabilidad.
Pero el hardware por sí solo no es suficiente para impulsar la adopción. La nueva iniciativa, conocida internamente como “TorchTPU”, busca eliminar una barrera clave que frenó la adopción de los chips TPU, haciéndolos totalmente compatibles y fáciles de usar para los desarrolladores, para los clientes que ya crearon su infraestructura tecnológica con el software PyTorch, señalan las fuentes.
Google también está considerando liberar partes del software para acelerar su adopción entre los clientes.
En comparación con intentos anteriores de implementar PyTorch en TPU, Google dedicó mayor enfoque organizativo, recursos e importancia estratégica a TorchTPU, a medida que crece la demanda de empresas que desean adoptar los chips, pero que consideran que la pila de software es un cuello de botella, según las fuentes.
PyTorch, un proyecto de código abierto con un fuerte apoyo de Meta Platforms, es una de las herramientas más utilizadas por los desarrolladores que crean modelos de IA. En Silicon Valley, muy pocos desarrolladores escriben cada línea de código que los chips de Nvidia, Advanced Micro Devices o Google realmente ejecutarán.
En cambio, estos desarrolladores confían en herramientas como PyTorch, que consiste en una colección de bibliotecas y frameworks de código preescritos que automatizan muchas tareas comunes en el desarrollo de software de IA.
Te interesa: OpenAI y Google compiten por usuarios y datos de entrenamiento en la India con cuentas gratis
Lanzado originalmente en 2016, la historia de PyTorch ha estado estrechamente ligada al desarrollo de CUDA por parte de Nvidia, el software que algunos analistas de Wall Street consideran la protección más sólida de la compañía contra la competencia.
Los ingenieros de Nvidia dedicaron años a garantizar que el software desarrollado con PyTorch se ejecute de la forma más rápida y eficiente posible en sus chips. En cambio, Google lleva mucho tiempo utilizando un marco de código diferente llamado Jax para sus ejércitos internos de desarrolladores de software, y sus chips TPU emplean una herramienta llamada XLA para que dicho código se ejecute de forma eficiente. Gran parte del software de IA y la optimización del rendimiento de Google se basó en Jax, lo que amplía la brecha entre cómo Google usa sus chips y cómo los clientes desean usarlos.
“Estamos observando una demanda masiva y creciente de nuestra infraestructura de TPU y GPU”, declaró el portavoz. “Nos centramos en proporcionar la flexibilidad y la escalabilidad que necesitan los desarrolladores, independientemente del hardware sobre el que decidan construir”.
Te recomendamos: Nvidia considera aumentar la producción de chips H200 debido a la sólida demanda de China
TPU para clientes
Alphabet había reservado durante mucho tiempo la mayor parte de sus propios chips, o TPU, exclusivamente para uso interno. Esto cambió en 2022, cuando la unidad de computación en la nube de Google presionó con éxito para supervisar al grupo que vende las TPU. Esta medida incrementó drásticamente la asignación de TPU de Google Cloud y, a medida que crecía el interés de los clientes en la IA, Google ha buscado capitalizarla incrementando la producción y las ventas de TPU a clientes externos.
Sin embargo, la discordancia entre los frameworks de PyTorch utilizados por la mayoría de los desarrolladores de IA del mundo y los frameworks de Jax, para los que los chips de Google están actualmente mejor optimizados, implica que la mayoría de los desarrolladores no pueden adoptar fácilmente los chips de Google y lograr que rindan tan bien como los de Nvidia sin realizar un importante trabajo de ingeniería adicional. Este trabajo requiere tiempo y dinero en la vertiginosa carrera de la IA.
Si tiene éxito, la iniciativa “TorchTPU” de Google podría reducir significativamente los costes de cambio para las empresas que buscan alternativas a las GPU de Nvidia. El dominio de Nvidia se vio reforzado no solo por su hardware, sino también por su ecosistema de software CUDA, que está profundamente integrado en PyTorch y se ha convertido en el método predeterminado mediante el cual las empresas entrenan y ejecutan grandes modelos de IA.
Los clientes empresariales han estado diciéndole a Google que las TPU son más difíciles de adoptar para las cargas de trabajo de IA porque históricamente requerían que los desarrolladores cambiaran a Jax, un marco de aprendizaje automático favorecido internamente en Google, en lugar de PyTorch, que la mayoría de los desarrolladores de IA ya usan, dijeron las fuentes.
Con información de Reuters












