reasoning_effort. Veja suporte por modelo para detalhes.
Lendo a saída
Modelos de raciocínio retornam seu pensamento em um campo separadoreasoning_content, mantendo content limpo:
Alguns provedores (Anthropic, Google, OpenAI, Qwen) retornam tokens de raciocínio criptografados ou resumidos. Quando isso acontece,
reasoning_content contém um placeholder "[Some reasoning content is encrypted]".Streaming
Ao fazer streaming,reasoning_content chega no delta antes da resposta final:
Esforço de raciocínio
O parâmetroreasoning_effort controla quanto pensamento um modelo faz antes de responder. Maior esforço significa raciocínio mais profundo, mas mais tokens e latência.
Valores aceitos
Suporte por modelo
OpenAI
Anthropic
xAI
Modelos Grok (Grok 4.1 Fast, Grok Code Fast) não suportamreasoning_effort. Especificá-lo resultará em erro.
Outros modelos
Uso
Passereasoning_effort como parâmetro de nível superior ou use o formato aninhado reasoning.effort:
"reasoning_effort": "high" também é aceito.
Desabilitando o raciocínio
Há duas formas de desabilitar o raciocínio:
Para modelos que suportam,
reasoning.enabled: false é a opção mais confiável:
Limites de tokens
Modelos de raciocínio geram tokens de resposta visível (emcontent) e tokens de raciocínio (em reasoning_content). Ambos contam para seu orçamento de tokens.
Definindo um limite de tokens
Usemax_completion_tokens para limitar o número total de tokens que o modelo gera, incluindo o raciocínio:
max_tokens também é aceito e se comporta da mesma forma. Se ambos forem definidos, max_completion_tokens tem precedência.
Para obter mais saída visível, aumente o limite, reduza reasoning_effort ou desabilite o raciocínio.
Lendo o detalhamento
O objetousage mostra como seu orçamento foi gasto:
finish_reason é length.
O limite superior de cada modelo está disponível como maxCompletionTokens no endpoint /v1/models.
Modelos sem raciocínio
max_tokens e max_completion_tokens se comportam da mesma forma em modelos sem raciocínio, limitando diretamente a saída visível.
Descoberta de capacidades
Verifique o que um modelo suporta pelo endpoint/v1/models:
Melhores práticas
- Use
mediumcomo padrão para uso geral - Use
highouxhighpara tarefas complexas (matemática, código, análise) - Use
lowpara aplicações sensíveis à latência - Use
reasoning.enabled: falseou defina effort comononepara desabilitar o raciocínio - Em caso de dúvida, use
low,mediumouhigh. Esses são os valores mais amplamente suportados.