Chain-of-Thought Prompting (PT)

From Systems analysis wiki
Jump to navigation Jump to search

Chain-of-Thought Prompting (CoT, prompts em "cadeia de pensamento") é uma técnica de engenharia de prompt que visa aprimorar a capacidade dos grandes modelos de linguagem (LLMs) de resolver problemas complexos que exigem raciocínio em várias etapas. Em vez de gerar uma resposta imediatamente, um prompt CoT incentiva o modelo a primeiro reproduzir explicitamente a sequência de passos intermediários de raciocínio que levam à conclusão final.

Essa abordagem, que imita o processo de pensamento humano, aumenta significativamente a precisão dos modelos em tarefas aritméticas, lógicas e simbólicas.

Ideia Principal

O princípio fundamental do CoT é fazer com que o modelo "pense em voz alta" em linguagem natural antes de fornecer a resposta final. A geração desses passos intermediários permite:

  • Decompor tarefas complexas: O modelo divide um problema complexo em subtarefas menores e mais gerenciáveis, concentrando-se em cada uma delas sequencialmente.
  • Minimizar erros: O processo passo a passo reduz a probabilidade de erros lógicos, que frequentemente ocorrem ao tentar dar uma resposta em uma única etapa.
  • Melhorar a transparência e a interpretabilidade: Usuários e desenvolvedores podem ver a lógica do modelo, o que facilita a depuração, a verificação e a construção de confiança nos resultados.

Contexto Histórico

A técnica CoT foi apresentada pela primeira vez em 28 de janeiro de 2022 por pesquisadores do Google Research no artigo "Chain of Thought Prompting Elicits Reasoning in Large Language Models" (Jason Wei, Denny Zhou et al.)[1]. Eles descobriram que fornecer ao modelo alguns exemplos de tarefas com soluções passo a passo (few-shot CoT) aumentava drasticamente seu desempenho em problemas complexos.

Essa descoberta mostrou que a capacidade de raciocínio em várias etapas é uma propriedade emergente de modelos grandes. Como observado no artigo original, o CoT só proporciona um aumento de desempenho em modelos que atingiram uma certa escala (cerca de 100 bilhões de parâmetros ou mais) e está praticamente ausente em modelos menores, que, ao usar CoT, podem gerar raciocínios ilógicos e apresentar resultados piores.

Tipos de CoT Prompting

Few-Shot CoT: Aprendizado com Exemplos

Este é o método original e mais confiável de CoT.

  • Princípio: O modelo recebe alguns (geralmente de 2 a 8) exemplos, cada um consistindo em um conjunto de: pergunta — cadeia de raciocínio — resposta.
  • Vantagens: Alta precisão, pois o modelo aprende um estilo e formato específico de raciocínio.
  • Desvantagens: Requer a criação manual de exemplos de alta qualidade e diversificados.

Zero-Shot CoT: "Vamos pensar passo a passo"

Este método foi proposto posteriormente, em 24 de maio de 2022, no artigo "Large Language Models are Zero-Shot Reasoners" (Takeshi Kojima et al.)[2] e é uma variante significativamente mais simples.

  • Princípio: Uma frase de gatilho simples é adicionada à solicitação original, como, por exemplo, "Vamos pensar passo a passo" (em inglês: "Let's think step by step").
  • Vantagens: Simplicidade, flexibilidade e ausência da necessidade de exemplos.
  • Desvantagens: Pode ser menos preciso que o Few-Shot CoT para tarefas muito específicas.

Automatic CoT (Auto-CoT)

Esta abordagem, proposta no trabalho de Zhang et al. (2022)[3], automatiza a criação de demonstrações para o Few-Shot CoT.

  • Princípio:
  1. As perguntas de um novo conjunto de dados são clusterizadas.
  2. De cada cluster, uma pergunta representativa é selecionada.
  3. Para essas perguntas, uma cadeia de raciocínio é gerada usando o Zero-Shot CoT.
  4. As demonstrações resultantes são usadas para formar o prompt.
  • Objetivo: Reduzir o esforço manual e escalar a aplicação do CoT, alcançando um desempenho comparável à criação manual de exemplos.

CoT Multimodal

Aplicação do CoT a tarefas que incluem dados de múltiplas modalidades (texto e imagens).

  • Princípio: O modelo gera raciocínios que conectam informações textuais e visuais.
  • Aplicação: Análise de diagramas, resolução de quebra-cabeças visuais.

Mecanismos e Eficácia

  • Melhoria do raciocínio: O CoT guia o modelo através de um processo de solução estruturado, o que minimiza erros lógicos e permite um uso mais eficaz de sua base de conhecimento.
  • Evidências empíricas: A eficácia do CoT é especialmente notável em benchmarks complexos. Por exemplo, no benchmark de aritmética GSM8K, o método básico Few-Shot CoT aumentou a precisão do modelo PaLM-540B de 17.9% para 58.1%. A aplicação de técnicas mais avançadas baseadas em CoT (como Self-Consistency) permite alcançar uma precisão de 74–78%.
  • Papel do formato do raciocínio: Estudos mostraram que mesmo exemplos com passos intermediários incorretos podem melhorar o resultado se a estrutura geral do raciocínio for mantida. Isso sugere que o CoT ensina principalmente ao modelo o formato do pensamento passo a passo.

Relação com Outras Técnicas

O CoT é um componente fundamental para métodos mais avançados:

  • Self-Consistency: Gera várias cadeias de CoT diferentes para a mesma pergunta e seleciona a resposta mais frequente por meio de votação. Isso aumenta significativamente a confiabilidade, proporcionando um ganho de precisão nos benchmarks GSM8K[4] (+17.9%)[5], SVAMP[6] (+11.0%)[1] e AQuA[7] (+12.2%)[1].
  • Tree of Thoughts (ToT): Generaliza o CoT ao explorar não apenas um, mas uma árvore inteira de possíveis caminhos de raciocínio. Diferente da cadeia linear do CoT, o ToT permite que o modelo explore vários ramos, avalie "pensamentos" intermediários e retorne (backtracking) ao encontrar um caminho sem perspectiva. Isso possibilita a resolução de tarefas ainda mais complexas, onde um simples raciocínio linear não é suficiente (por exemplo, aumentando a precisão na resolução do problema "Game of 24"[8] de 4% para 74%)[9].

Ver também

  • Grandes modelos de linguagem
  • Engenharia de prompt
  • Emergência

Literatura

  • Wei, J. et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. arXiv:2201.11903.
  • Wang, X. et al. (2022). Self-Consistency Improves Chain of Thought Reasoning in Language Models. arXiv:2203.11171.
  • Kojima, T. et al. (2022). Large Language Models are Zero-Shot Reasoners. arXiv:2205.11916.
  • Zhou, D. et al. (2022). Least-to-Most Prompting Enables Complex Reasoning in Large Language Models. arXiv:2205.10625.
  • Zhang, Z. et al. (2022). Automatic Chain of Thought Prompting in Large Language Models. arXiv:2210.03493.
  • Lyu, Q. et al. (2023). Faithful Chain-of-Thought Reasoning. arXiv:2301.13379.
  • Wang, X. et al. (2023). Deductive Verification of Chain-of-Thought Reasoning. arXiv:2306.03872.
  • Yao, S. et al. (2023). Tree of Thoughts: Deliberate Problem Solving with Large Language Models. arXiv:2305.10601.
  • Lightman, H. et al. (2023). Let’s Verify Step by Step. arXiv:2305.20050.
  • Yang, B. et al. (2025). Hallucination Detection in Large Language Models with Metamorphic Relations. arXiv:2502.15844.

Notas

  1. 1.0 1.1 1.2 Wei, Jason, Xuezhi Wang, Dale Schuurmans, Maarten Bosma, Brian Ichter, Fei Xia, Ed Chi, Quoc Le, e Denny Zhou. «Chain-of-Thought Prompting Elicits Reasoning in Large Language Models». arXiv, 10 de janeiro de 2023. https://doi.org/10.48550/arXiv.2201.11903.[1]
  2. Kojima, Takeshi, Shixiang Shane Gu, Machel Reid, Yutaka Matsuo, e Yusuke Iwasawa. «Large Language Models are Zero-Shot Reasoners». arXiv, 29 de janeiro de 2023. https://doi.org/10.48550/arXiv.2205.11916.[2]
  3. Zhang, Zhuosheng, Aston Zhang, Mu Li, e Alex Smola. «Automatic Chain of Thought Prompting in Large Language Models». arXiv, 7 de outubro de 2022. https://doi.org/10.48550/arXiv.2210.03493.[3]
  4. «openai/gsm8k · Datasets at Hugging Face», 17 de julho de 2023. https://huggingface.co/datasets/openai/gsm8k.[4]
  5. Wang, Xuezhi, Jason Wei, Dale Schuurmans, Quoc Le, Ed Chi, Sharan Narang, Aakanksha Chowdhery, e Denny Zhou. «Self-Consistency Improves Chain of Thought Reasoning in Language Models». arXiv, 7 de março de 2023. https://doi.org/10.48550/arXiv.2203.11171.[5]
  6. Patel, Arkil. «arkilpatel/SVAMP». Python, 30 de maio de 2025. https://github.com/arkilpatel/SVAMP.[6]
  7. «autonlab/aqua». Jupyter Notebook. 2022. Reprint, Auton Lab, Carnegie Mellon University, 12 de junho de 2025. https://github.com/autonlab/aqua.[7]
  8. «24 (Puzzle)». Em Wikipedia [8]
  9. Yao, Shunyu, Dian Yu, Jeffrey Zhao, Izhak Shafran, Thomas L. Griffiths, Yuan Cao, e Karthik Narasimhan. «Tree of Thoughts: Deliberate Problem Solving with Large Language Models». arXiv, 3 de dezembro de 2023. https://doi.org/10.48550/arXiv.2305.10601.[9]