LLaMA (Meta AI) (PT)
LLaMA (Large Language Model Meta AI) — é uma família de grandes modelos de linguagem (LLM) predominantemente de código aberto, desenvolvida pela divisão de pesquisa Meta AI. Os modelos LLaMA são construídos sobre uma arquitetura transformer modificada e são focados em alta eficiência computacional, democratização do acesso a tecnologias de IA de ponta e fácil adaptação para tarefas especializadas. A família evoluiu desde o lançamento inicial de pesquisa LLaMA 1 (fevereiro de 2023) até os modelos multimodais LLaMA 4 (lançamento previsto para 2025).
Nomenclatura
A sigla LLaMA significa Large Language Model Meta AI (Grande Modelo de Linguagem da Meta AI).
- Large Language Model — destaca a escala dos modelos, cujos parâmetros são medidos em bilhões a trilhões.
- Meta AI — indica a desenvolvedora, o grupo de pesquisa da Meta.
História da Criação
O desenvolvimento do LLaMA começou no final de 2022 como uma resposta estratégica da Meta ao sucesso do ChatGPT da OpenAI. Mark Zuckerberg formou uma equipe interdisciplinar, incluindo pesquisadores do laboratório FAIR (Facebook AI Research). Um papel fundamental na filosofia do projeto foi desempenhado por Yann LeCun, chefe do FAIR, que desde 2013 adere ao princípio da abertura total de todas as pesquisas do laboratório.
A primeira versão, LLaMA 1, foi lançada em fevereiro de 2023 com uma licença de pesquisa. Logo após o lançamento, em março de 2023, os pesos do modelo vazaram na internet via BitTorrent. Este evento, ao contrário dos temores, não paralisou, mas, pelo contrário, impulsionou o desenvolvimento do projeto, pois deu a pesquisadores independentes e entusiastas de todo o mundo a oportunidade de experimentar o modelo. Como resultado, dezenas de milhares de modelos derivados apareceram na plataforma Hugging Face. As versões subsequentes, a partir do LLaMA 2, foram lançadas com uma licença comercial[1], consolidando o status do LLaMA como um ator-chave no mercado de modelos de IA abertos.
Evolução dos Modelos e Cronologia de Lançamentos
| Versão | Data de Lançamento | Intervalo de Parâmetros | Inovações e Características Principais |
|---|---|---|---|
| LLaMA 1 | Fevereiro de 2023 | 7B – 65B | Arquitetura base (RMSNorm, SwiGLU, RoPE). Treinado com 1,4 trilhão de tokens. Janela de contexto de 2048 tokens. Licença de pesquisa. |
| LLaMA 2 | Julho de 2023 | 7B – 70B | Fine-tuning para diálogos (RLHF). Implementação do Grouped-Query Attention (GQA). Janela de contexto de 4096 tokens. Primeira licença comercial. |
| Code Llama | Agosto de 2023 | 7B – 70B | Versão especializada para código. Fine-tuning com 500 bilhões de tokens de código. Variantes: base, especializada em Python, instruction-tuned. |
| LLaMA 3 | Abril de 2024 | 8B, 70B | Treinado com 15 trilhões de tokens. Tokenizador aprimorado com um vocabulário de 128 mil tokens. Alto desempenho (82% no MMLU). |
| LLaMA 3.1 | Julho de 2024[2] | 8B, 70B, 405B | Modelo principal de 405B com desempenho no nível do GPT-4o. Janela de contexto de até 128 mil tokens. Introduzida a capacidade de processar imagens. |
| LLaMA 4 | (plano: abril de 2025) | 109B (Scout), 400B (Maverick), 2T (Behemoth) | Arquitetura Mixture-of-Experts (MoE). Multimodalidade nativa (texto, imagens, vídeo). Janela de contexto de até 10 milhões de tokens. |
Arquitetura
O LLaMA utiliza uma arquitetura de transformer decoder autorregressivo, mas introduz uma série de melhorias importantes que aumentam a eficiência computacional e a qualidade do texto gerado:
- Pré-normalização (Pre-normalization). A normalização é aplicada na entrada de cada subcamada do transformer, e não na saída. Essa abordagem estabiliza o treinamento de redes muito profundas e previne problemas com gradientes.
- RMSNorm (Root Mean Square Layer Normalization). Em vez da LayerNorm padrão, é usada a RMSNorm. Essa técnica de normalização elimina a operação de subtração da média, o que acelera os cálculos em 10–50% mantendo a estabilidade.
- SwiGLU (Swish-Gated Linear Unit). Como função de ativação, em vez de ReLU ou GELU, é utilizada a SwiGLU. Este mecanismo de gating (gating mechanism) cria um fluxo de gradiente mais suave e melhora a qualidade do modelo.
- RoPE (Rotary Position Embeddings, Embeddings de Posição Rotacionais). Para codificar as posições dos tokens, são aplicados embeddings de posição relativos RoPE, que permitem ao modelo extrapolar melhor para sequências mais longas do que as usadas durante o treinamento.
- GQA (Grouped-Query Attention). Implementada no LLaMA 2, essa técnica é uma otimização da atenção multi-cabeça (multi-head attention) que reduz significativamente os requisitos de memória e acelera a geração de texto.
- Mixture-of-Experts (MoE) (planejada para o LLaMA 4). Uma arquitetura que divide os parâmetros do modelo em sub-redes "especialistas", ativando apenas uma pequena parte delas para cada consulta. Isso reduz drasticamente os custos computacionais para a inferência.
Configurações do LLaMA 1
| Modelo | Parâmetros | Dimensão do Estado Oculto | Nº de Camadas | Nº de Cabeças de Atenção | Volume de Dados de Treinamento |
|---|---|---|---|---|---|
| 7B | 6.7B | 4096 | 32 | 32 | 1.0T tokens |
| 13B | 13.0B | 5120 | 40 | 40 | 1.0T tokens |
| 33B | 32.5B | 6656 | 60 | 52 | 1.4T tokens |
| 65B | 65.2B | 8192 | 80 | 64 | 1.4T tokens |
Dados de Treinamento
O volume dos corpus de treinamento cresceu de 1,4 trilhão de tokens para o LLaMA 1 para 15 trilhões para o LLaMA 3. Para o treinamento, são utilizadas fontes publicamente acessíveis, incluindo Common Crawl (que compõe até 67% dos dados), C4, GitHub, Wikipedia, Books, ArXiv e Stack Exchange. Para o LLaMA 3, também foram utilizados dados privados de alta qualidade.
Desempenho e Comparação
- Em benchmarks: O modelo LLaMA 3.1 (405B) apresenta resultados próximos aos do GPT-4o: no teste MMLU, ele atinge 88,6%, ficando apenas 0,1 ponto percentual atrás do GPT-4o. Na tarefa de geração de código HumanEval, o LLaMA 3.1 alcança 89% (GPT-4o — 90,2%).
- Eficiência paramétrica: Os modelos LLaMA com um número menor de parâmetros frequentemente superam modelos maiores de concorrentes. Por exemplo, o LLaMA 1 (13B) superou o GPT-3 (175B) na maioria dos benchmarks.
- Custo: Com hospedagem local, o custo da inferência do LLaMA pode ser até 50 vezes menor em comparação com o uso de APIs proprietárias, tornando a tecnologia acessível para pequenas e médias empresas.
Licenciamento
- O LLaMA 1 foi distribuído sob uma licença de pesquisa não comercial, com acesso mediante solicitação.
- O LLaMA 2 e versões posteriores são distribuídos sob a Llama Community License, que permite uso comercial e modificação. No entanto, a licença contém restrições: empresas com mais de 700 milhões de usuários ativos mensais devem obter uma permissão especial da Meta. Isso gera debates sobre se o LLaMA é um modelo totalmente aberto.
Aplicações
Os modelos LLaMA estão integrados nos produtos de milhares de empresas e são utilizados em diversas áreas:
- Setor corporativo: O Zoom utiliza o LLaMA no AI Companion para resumir reuniões; a Shopify o utiliza para processar de 40 a 60 milhões de solicitações por dia para enriquecer metadados de produtos; a Instacart o usa em seu assistente interno, Ava.
- Ciência e sociedade: O Meditron (uma adaptação do LLaMA) é usado para diagnóstico médico em regiões com recursos limitados;
- Setor público e indústria: A Meta firmou parcerias com a Lockheed Martin e a Palantir. A NASA utiliza o LLaMA 3 na Estação Espacial Internacional (ISS) como um assistente offline para realizar operações críticas sem comunicação com a Terra.
Limitações e Críticas
- Vieses e segurança: Auditorias independentes mostram que os modelos LLaMA, apesar das medidas de segurança, podem reproduzir estereótipos prejudiciais. O vazamento dos pesos do LLaMA 1 levantou questões sobre o potencial uso malicioso da tecnologia.
- Lacunas de conhecimento: Em áreas altamente especializadas, o LLaMA pode apresentar lacunas. Por exemplo, a precisão no teste médico nephSAP foi de 17–30% em comparação com 73% para o GPT-4.
- Consumo de energia: O treinamento de modelos grandes exige enormes recursos. O treinamento do LLaMA 1 consumiu 2.638 MWh, o que equivale à emissão de 1.015 toneladas de CO₂.
Futuro
A Meta planeja investir até 65 bilhões de dólares em infraestrutura de IA até 2025. Está em desenvolvimento o modelo LLaMA 4 Behemoth com 2 trilhões de parâmetros, que suportará mais de 200 idiomas e terá uma integração profunda com os produtos do metaverso.
Ver também
- GPT
- Grandes modelos de linguagem
- Transformer (arquitetura de rede neural)
Literatura
- Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
- Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Grattafiori, A. et al. (2024). The Llama 3 Herd of Models. arXiv:2407.21783.
- Jiang, Z. et al. (2023). Pre‑RMSNorm and Pre‑CRMSNorm Transformers: Equivalent and Efficient Pre‑LN Transformers. arXiv:2305.14858.
- Rozière, B. et al. (2023). Code Llama: Open Foundation Models for Code. arXiv:2308.12950.
- Shazeer, N. (2020). GLU Variants Improve Transformer. arXiv:2002.05202.
- Su, J. et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
- Touvron, H. et al. (2023). LLaMA: Open and Efficient Foundation Language Models. arXiv:2302.13971.
- Touvron, H. et al. (2023). Llama 2: Open Foundation and Fine‑Tuned Chat Models. arXiv:2307.09288.
- Zhang, B.; Sennrich, R. (2019). Root Mean Square Layer Normalization. arXiv:1910.07467.
Notas
- ↑ A licença do LLaMA não atende a todos os critérios de software de código aberto, pois impõe restrições ao uso comercial pelas maiores empresas e exige a divulgação de informações sobre modificações.
- ↑ O LLaMA 3.1 foi anunciado e lançado em julho de 2024. Veja o anúncio oficial da Meta.