Tokens definem custo e limite de memória do modelo. Temperatura e top_p controlam aleatoriedade. Dominar esses knobs evita respostas truncadas ou inconsistentes.
Estimativa rápida (português): Texto com ~1.200 palavras → ~1.600 tokens Código PHP médio (200 linhas) → ~800–1.200 tokens Se context_window = 8.192 tokens e max_tokens saída = 1.024: espaço útil para prompt ≈ 7.168 tokens
| Parâmetro | Faixa usual | Efeito |
|---|---|---|
| temperature | 0 – 2 | 0 = repetível; alto = mais criativo/arriscado |
| top_p | 0 – 1 | Amostra só dos tokens mais prováveis (núcleo) |
Mesmo prompt, temperatura diferente: Prompt: "Liste 3 ideias de projeto para portfólio ADS." temperature = 0.2 → ideias previsíveis (CRUD, API REST, todo app) temperature = 0.9 → ideias mais variadas (IoT, gamificação, IA local…) Para produção automatizada, prefira 0–0.3 e valide a saída.
Memória da IA, limite de tokens, degradação do contexto e erros comuns no dia a dia.