IBM Granite (modelo de lenguaje)

From Systems analysis wiki
Jump to navigation Jump to search

IBM Granite es una serie de grandes modelos de lenguaje (LLM) desarrollados por IBM para su aplicación en entornos corporativos. Los modelos Granite son transformadores autorregresivos con una arquitectura de solo decodificador, capaces de generar texto a partir de un contexto dado[1].

La familia fue presentada oficialmente el 7 de septiembre de 2023 como parte del lanzamiento de la plataforma en la nube IBM watsonx.ai[2]. IBM posiciona a Granite como soluciones abiertas, de alto rendimiento y confiables para empresas, haciendo hincapié en la transparencia de los datos de entrenamiento, el control de riesgos y un licenciamiento que permite el uso comercial[3].

Historia del desarrollo

La familia de modelos Granite se convirtió en parte de la estrategia de IBM para ofrecer a las empresas sus propios modelos generativos junto con los de sus socios.

  • Septiembre de 2023: Anuncio oficial y lanzamiento de los primeros modelos en la plataforma watsonx.ai. Las primeras versiones, Granite.13b.instruct y Granite.13b.chat, tenían alrededor de 13 mil millones de parámetros y estaban orientadas a tareas clave de procesamiento del lenguaje[2].
  • Mayo de 2024: IBM anuncia el lanzamiento de código abierto de varios modelos Granite Code (de 3 a 34 mil millones de parámetros) bajo la licencia Apache 2.0. Los pesos de los modelos se publicaron en la plataforma Hugging Face, lo que representó un paso importante en el apoyo al ecosistema abierto de la IA[4].
  • Otoño de 2024: IBM lanza la actualización Granite 3.0, que incluye modelos de menor tamaño (2 y 8 mil millones de parámetros) y nuevas funcionalidades, confirmando su compromiso con la expansión de la familia[5].

Arquitectura y entrenamiento

Arquitectura

Los modelos IBM Granite están construidos sobre una arquitectura de transformador solo decodificador (decoder-only), similar a los modelos GPT. El modelo base Granite.13b utiliza el mecanismo de atención multiconsulta (multi-query attention) y tiene una ventana de contexto de hasta 8000 tokens[6]. Los modelos se entrenan mediante aprendizaje autosupervisado (self-supervised learning).

Datos de entrenamiento y Gobernanza de la IA

Una característica clave de Granite es el uso de un corpus de datos propio y curado, seleccionado para satisfacer las necesidades de las empresas. A diferencia de muchos LLM que se entrenan con muestras web sin filtrar, Granite se entrenó con datos de alta calidad (enterprise-quality) que abarcan los siguientes dominios[6]:

  • Datos académicos y científicos: literatura científica, publicaciones técnicas.
  • Código de programación: grandes volúmenes de código en múltiples lenguajes.
  • Jurisprudencia: decisiones judiciales, informes públicos.
  • Finanzas: informes financieros de empresas.
  • Internet: textos no estructurados de carácter general que han sido filtrados.

IBM destaca que el desarrollo siguió estrictos principios de Gobernanza de la IA (ética y gestión de datos). Cada conjunto de datos fue sometido a un proceso de verificación para asegurar el cumplimiento de las políticas corporativas. Para eliminar contenido no deseado, se utilizó un detector interno llamado «HAP» (Hate and Profanity), así como listas de bloqueo automáticas de recursos web[1]. IBM publicó un informe técnico detallado con una lista de fuentes, un paso poco común para las grandes empresas tecnológicas que garantiza una alta transparencia.

Familia de modelos Granite

La familia IBM Granite abarca varias categorías de modelos para diferentes tareas empresariales:

  • Modelos de lenguaje (Granite Language Models): Modelos base y ajustados por instrucciones para tareas de procesamiento de texto: generación, resumen, clasificación, etc.
  • Modelos de código (Granite Code Models): LLM especializados, entrenados en más de 100 lenguajes de programación, para autocompletar, generar y corregir código. Disponibles en tamaños de 3 a 34 mil millones de parámetros[4].
  • Modelos de visión (Granite Vision Models): Redes neuronales para el análisis de imágenes y documentos, reconocimiento de texto y comprensión de contenido.
  • Modelos de voz (Granite Speech Models): Modelos compactos para el reconocimiento y la traducción de voz.
  • Modelos para series temporales (Granite for Time Series): Modelos especializados para la predicción basada en series de tiempo.
  • Modelo geoespacial (Granite for Geospatial): Desarrollado en colaboración con la NASA para analizar imágenes satelitales y otros datos geoespaciales.
  • Modelos de embeddings (Granite Embedding Models): Modelos para tareas de búsqueda semántica y construcción de sistemas RAG.
  • Granite Guardian: Un módulo especializado para garantizar la seguridad, diseñado para filtrar solicitudes no deseadas y monitorear el contenido.

Código abierto y licenciamiento

IBM ha puesto un énfasis significativo en la naturaleza abierta de la familia Granite, posicionándola como una alternativa transparente a los LLM propietarios y de código cerrado. En mayo de 2024, la compañía liberó los modelos base de Granite Code a la comunidad de código abierto bajo la licencia Apache 2.0, lo que permite su uso, modificación y distribución libres[4].

Este paso, junto con la publicación de información detallada sobre los datos de entrenamiento, le valió a IBM un gran reconocimiento por parte de la comunidad investigadora. En 2024, el modelo alcanzó una de las primeras posiciones en el Índice de Transparencia de Modelos Fundacionales de la Universidad de Stanford[3].

Aplicaciones

Los modelos Granite están integrados en la plataforma en la nube IBM watsonx y se utilizan en diversos escenarios corporativos.

  • Análisis deportivo (US Open): En colaboración con la Asociación de Tenis de los Estados Unidos (USTA), IBM utiliza Granite para generar automáticamente informes de partidos y comentarios de audio después de cada encuentro en el torneo US Open. La solución genera un resumen detallado del partido en cuestión de minutos después de su finalización[7].
  • Asistencia para programadores: Los modelos Granite Code son la base de IBM watsonx Code Assistant, una familia de herramientas que pueden, por ejemplo, convertir automáticamente código obsoleto en COBOL a microservicios modernos para IBM Z[4].
  • Aplicaciones de IA sectoriales: Lockheed Martin ha integrado los modelos Granite en su plataforma AI Factory para tareas de seguridad nacional. ESPN utiliza Granite para generar comentarios personalizados en los deportes de fantasía[3].

Literatura

  • Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
  • Awasthy, P. et al. (2025). Granite Embedding Models. arXiv:2502.20204.
  • Dao, T. et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
  • Ding, Y. et al. (2024). LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens. arXiv:2402.13753.
  • Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • Granite Vision Team (2025). Granite Vision: A Lightweight, Open‑Source Multimodal Model for Enterprise Intelligence. arXiv:2502.09927.
  • Mishra, M. et al. (2024). Granite Code Models: A Family of Open Foundation Models for Code Intelligence. arXiv:2405.04324.
  • Padhi, I. et al. (2024). Granite Guardian: Risk Detection for Safe and Responsible Use of LLMs. arXiv:2412.07724.
  • Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of Large Language Models. arXiv:2309.00071.
  • Stallone, M. et al. (2024). Scaling Granite Code Models to 128K Context. arXiv:2407.13739.

Referencias

  1. 1.0 1.1 «Building AI for business: IBM's Granite foundation models». IBM Blog. [1]
  2. 2.0 2.1 Lardinois, Frederic (7 de septiembre de 2023). «IBM rolls out new generative AI features and models». TechCrunch. [2]
  3. 3.0 3.1 3.2 «Granite». IBM. [3]
  4. 4.0 4.1 4.2 4.3 «IBM's Granite code model family is going open source». IBM Research Blog. [4]
  5. «Granite 3.3 Language Models - a ibm-granite Collection». Hugging Face. [5]
  6. 6.0 6.1 «Granite Foundation Models: Technical Specifications». IBM. [6]
  7. «IBM and the USTA Serve Up New and Enhanced Generative AI Features for 2024 US Open Digital Platforms». IBM Newsroom. [7]