O lançamento, em contexto
Sol e Luna ampliam a família GPT-6 anunciada com Astra. A disponibilidade inicial inclui API, Codex e ChatGPT Work; a liberação é gradual. O anúncio distingue Work do Chat, onde estes modelos ainda não estavam disponíveis.
Para escolher: Luna atende tarefas delimitadas em volume; Sol é candidato a raciocínio e programação exigentes; Astra permanece uma opção para problemas de maior complexidade. A escolha final deve vir de testes com as tarefas do seu sistema.
Luna · volume
Hipótese de uso INEMA: triagem de mensagens, classificação de catálogo, extração e primeiros resumos.
Sol · complexidade
Hipótese de uso INEMA: revisão de integrações, sínteses com várias fontes e resolução de casos ambíguos.
Astra · exceções
Hipótese de uso INEMA: avaliação de arquiteturas e problemas difíceis após medir se o ganho compensa.
Pesquisa, gráficos, calculadora e gerador de exemplo JSON funcionam no navegador. O plano de integração é uma proposta: não ativa modelos, não envia seus dados a uma API e não altera os sistemas em produção.
Preço por token não é custo por tarefa
USD por 1 milhão de tokens. Standard, contexto até 272 mil tokens de entrada. Consulta em 22/09/2026.
Em telas pequenas, deslize a tabela para ver todas as colunas.
| Modelo | Entrada | Leitura de cache | Gravação de cache | Saída |
|---|---|---|---|---|
| GPT-6 Luna | US$ 0,1 | US$ 0,01 | US$ 0,125 | US$ 0,5 |
| GPT-6 Sol | US$ 2 | US$ 0,2 | US$ 2,5 | US$ 10 |
Ficha técnica: GPT-6 Sol ↗ · Ficha técnica: GPT-6 Luna ↗
Antes e depois: tarifa de saída
US$ por milhão · escala linear, de 0 a 20
Lançamento: Sol e Luna ↗ · Comparação com as tarifas promocionais anteriores. Cálculo: queda de 50% em Sol e 58,3% na saída de Luna; não arredondamos ambas para 50%.
Sol e Luna: janela de 1.050.000 tokens e saída máxima de 128.000. Acima de 272.000 tokens de entrada, toda a chamada recebe multiplicadores de 2× na entrada/cache e 1,5× na saída. Batch e Flex custam 50% de Standard; Fast custa 2×. Processamento regional acrescenta 10% onde disponível.
A tarifa de Sol é 20 vezes a de Luna em cada categoria acima. Isso não significa que uma tarefa custará 20 vezes mais: quantidade de tokens, raciocínio, tentativas e ferramentas mudam o total.
Compare tarefas, esforço e resultado
Resultados publicados pela fabricante. Não são medições deste projeto nem um ranking geral de inteligência.
Lançamento: Sol e Luna ↗ · Baixar dados CSV
Como interpretar
Uma diferença pequena de pontuação não prova equivalência. Faltam intervalos de confiança e repetição local. Preserve a versão do teste, o esforço e as ferramentas ao comparar. Os gráficos começam em zero para evitar ampliar visualmente diferenças mínimas.
Um agente depende do modelo e do ambiente: instruções, busca, execução de código e tempo disponível. Para nós, o resultado útil é uma tarefa aceita pelo usuário com custo e prazo previsíveis. Pontuação publicada ajuda a escolher candidatos; o piloto decide a adoção.
Simule o custo do seu volume
Estimativa matemática de tokens de texto, sem chamadas de IA. Ajuste os valores ao uso observado no seu sistema.
Fórmula: chamadas × [(tokens comuns × tarifa + tokens lidos × tarifa de cache + tokens gravados × tarifa de gravação) × fator de contexto + saída × tarifa de saída × fator de contexto] ÷ 1.000.000 × modalidade.
Leitura, gravação e entrada comum são categorias exclusivas; gravação não soma uma segunda tarifa de entrada. Percentuais de cache são hipóteses, não garantias. A ferramenta aplica automaticamente o adicional por contexto longo.
O cálculo não inclui busca, arquivos, imagens, armazenamento, tributos, câmbio, processamento regional nem custo de desenvolvimento pelo agente. No modo revisão, a chamada ao Sol usa os mesmos tokens informados; acrescente contexto adicional se sua revisão real for maior. A duração da chamada e a qualidade não são estimadas.
Prompt caching e cobrança ↗ · Ficha técnica: GPT-6 Sol ↗ · Ficha técnica: GPT-6 Luna ↗
Uma arquitetura que pode crescer com o INEMA
Proposta INEMA: centralizar a escolha de modelo e reaproveitar as fontes que cada sistema já mantém.
O roteador decide pelo tipo de tarefa e por regras mensuráveis: quantidade de fontes, necessidade de alterar código, resultado da validação e teto disponível. Uma frase do modelo dizendo estar “confiante” não basta para liberar uma ação.
Começaríamos com consultas somente de leitura. O aplicativo autentica a pessoa, recupera o conteúdo permitido e entrega apenas os trechos necessários ao modelo. Cada resposta mantém referência à fonte e à revisão consultada.
O modelo pode solicitar uma função, mas o nosso servidor executa e verifica o resultado. Um pedido para enviar, publicar ou apagar precisa continuar obedecendo às permissões do sistema. Um conteúdo recuperado não ganha autoridade para mudar essas permissões.
Base técnica: Function calling ↗ · Conexões MCP ↗
Cache: reduzir repetição sem perder controle
Coloque instruções e esquemas estáveis antes do conteúdo variável. Registre o uso real do cache; ter uma conversa persistente não garante acerto. No GPT-6, alterações de esforço e disponibilidade de ferramentas podem preservar o prefixo reutilizável. Teste o efeito antes de prometer economia.
Onde integrar nos nossos sistemas
Mapeamento de código e documentação locais consultados em 22/09/2026. Não é uma auditoria do runtime de produção. As colunas de integração são propostas.
Em telas pequenas, deslize a tabela para ver todas as colunas.
| Sistema e ponto de partida | Experimento proposto | Trabalho de integração | Critério de aceitação |
|---|---|---|---|
| Portal / atendimento O código consultado prevê Agnes e fallback OpenRouter. | Piloto de Luna para dúvidas do catálogo; Sol quando há várias opções e restrições. | Adapter Responses na camada servidor, mantendo navegação e autorização. | Respostas com link correto; custo por atendimento resolvido. |
| Busca e Cérebro Catálogos derivados já alimentam busca e PRO. | Luna para extrair filtros; Sol para sintetizar resultados com fontes. | Recuperação antes da geração; acesso validado antes de enviar trechos. | Precisão das citações e ausência de conteúdo sem permissão. |
| Bots pessoais O bot consultado já centraliza orçamento e provedores. | Adicionar Luna/Sol como provedores opcionais, preservando a rota local. | Conectar no gateway existente e registrar o motivo de cada escalada. | Custo mensal, tempo p95 e proporção de escaladas úteis. |
| Conteúdo e cursos Publicação passa por arquivos e validação. | Luna prepara rascunhos estruturados; Sol revisa coerência e exemplos. | JSON com schema, validação de links e revisão editorial antes do git. | Retrabalho por texto e defeitos encontrados após revisão. |
| WebMCP e descoberta Manifestos descrevem o que cada sistema oferece. | Sol explica divergências encontradas pelo scanner; Luna classifica achados. | Usar evidência do scanner; manter declaração separada de execução. | Achados confirmados e falsos positivos. |
| Áudio e vídeo Pipelines de mídia têm etapas especializadas. | Aplicar Luna/Sol ao roteiro e ao texto já transcrito. | Manter transcrição, voz e renderização em suas ferramentas próprias. | Tempo de edição e precisão do roteiro final. |
É uma tarefa delimitada, verificável e reversível. Antes de mexer no atendimento, podemos comparar Luna com o fluxo atual em uma amostra pública, medir campos corretos, custo e revisão humana. Só depois expandir para respostas e ações.
Guia técnico: preparar um piloto reproduzível
O gerador abaixo prepara um corpo JSON. Ele não executa a requisição nem verifica acesso da conta aos modelos.
Endpoint: POST https://api.openai.com/v1/responses · Migração para Responses ↗
Escolha uma tarefa e uma amostra pública
Prepare 30–50 entradas reais anonimizadas, com o resultado esperado e exemplos difíceis. Essa faixa é uma proposta inicial de piloto, não um padrão oficial. Separe uma parte para desenvolvimento e outra para avaliação final.
Construa o adapter no servidor
Use uma chave da API carregada em runtime. Configure timeout, saída máxima, tentativas limitadas e orçamento. O exemplo omite ferramentas de propósito: acrescente funções apenas quando o executor estiver pronto.
Responses e Chat Completions têm formatos diferentes. Para Sol/Luna, a ficha técnica restringe function calling em Chat Completions a esforço none; prefira Responses quando precisar de ferramentas com raciocínio.
Valide a saída antes de usar
Para classificação, use Structured Outputs com JSON Schema. Validar a estrutura não prova que o conteúdo está correto: confira IDs existentes, links, categorias válidas e citações.
Compare com o sistema atual
Meça custo por tarefa aceita, tokens de raciocínio, latência p50/p95, falhas de ferramenta e correções humanas. Preserve prompt, esforço, versão do conjunto e modelo retornado. Não compare o melhor esforço de um modelo com o padrão do outro sem identificar isso.
Libere aos poucos
Comece em modo sombra, sem ações reais. Depois envie uma parcela pequena do tráfego ao candidato. Reverta pelo roteador se o custo ou os erros ultrapassarem o limite escolhido para o piloto.
Rodar este observatório localmente
git clone https://github.com/inematds/gpt6-sol-luna.git cd gpt6-sol-luna python3 -m http.server 8080 # Abra http://localhost:8080/guia/
Não precisa de dependências nem de chave para usar gráficos, simulador e gerador de JSON.
O que mais podemos construir
Ideias para próximos projetos. Ainda não implementadas aqui.
Assistente de pesquisa com referências
Busca atualizada, comparação das fontes e entrega de um dossiê com data de consulta. A busca web fornece citações; nossa interface precisa preservá-las e exibi-las junto das afirmações.
Revisor de catálogo
Encontrar descrições duplicadas, campos ausentes e links divergentes. Entregar propostas de correção em lote, com diff e possibilidade de rejeitar cada item.
Fábrica editorial assistida
Transformar uma pesquisa em roteiro, artigo, perguntas de revisão e briefing de imagem. Reutilizar uma base factual com origem para evitar versões contraditórias.
Painel de economia real
Mostrar gasto por sistema, acertos do cache, escaladas e tarefas aceitas. O indicador principal seria custo por entrega aproveitada, e não apenas tokens mais baratos.
Agentes conectados por MCP
Oferecer busca de projetos e leitura de fichas como ferramentas com contrato estável. Servidores privados exigem uma conexão apropriada; um endereço localhost não é acessível automaticamente pela API remota.
Revisão de interfaces e documentos
Analisar capturas de tela e apontar problemas para revisão. Sol/Luna recebem imagens; a arte final é gerada por um modelo especializado, como GPT Image 2.5.
Bases técnicas: Busca web com fontes ↗ · Conexões MCP ↗ · GPT Image 2.5 Sunburst ↗
Imagem, voz e texto são etapas distintas
GPT Image 2.5 Sunburst gera e edita imagens; sua cobrança usa tokens de imagem e texto, não a tabela de Sol/Luna. Não estimamos o custo de uma capa com o simulador de texto. A imagem desta página foi gerada pela ferramenta embutida do Codex; a subversão não foi exposta no retorno.
Do estudo à adoção
Dúvidas que mudam a decisão
A assinatura do Codex paga a API dos nossos sistemas?
Não presuma isso. Acesso no aplicativo e consumo por chave de API são canais diferentes. O piloto precisa confirmar acesso, orçamento e cobrança da conta usada pelo backend.
É só trocar o nome do modelo?
É preciso verificar o provedor, endpoint, formato de funções, parâmetros, tratamento de saída e limites. Um identificador da API OpenAI não comprova disponibilidade equivalente em um agregador.
O contexto de um milhão de tokens elimina a busca?
Não. Busca continua útil para selecionar conteúdo atual e autorizado, reduzir custo e manter referências. Contexto maior é capacidade, não recomendação de preencher tudo a cada chamada.
Qual é mais rápido nos nossos sistemas?
Ainda não medimos. O projeto não inventa tokens por segundo. Rede, fila, tamanho da entrada, esforço e ferramentas precisam entrar no teste de latência.
Fontes, método e dados abertos
Consulta em 22/09/2026. Priorizamos fontes oficiais e identificamos recomendações próprias. Nenhum benchmark foi executado pelo INEMA nesta entrega.
- Lançamento: Sol e Luna
- Ficha técnica: GPT-6 Sol
- Ficha técnica: GPT-6 Luna
- Guia da família GPT-6
- Prompt caching e cobrança
- Migração para Responses
- Function calling
- Structured Outputs
- Busca web com fontes
- Conexões MCP
- GPT Image 2.5 Sunburst
O levantamento local usou o código do chat do portal, documentação do bot, fluxo de catálogos e diretriz de descoberta do ecossistema. Esses registros orientam o plano; não comprovam a configuração ativa em produção.
Pesquisa em JSON · Benchmarks CSV · Preços CSV · Código e documentação
Dados de pesquisa e CSV preservam os identificadores e as medições originais; a documentação do repositório está em português.
Atualização editorial: revise as fontes antes de tomar uma decisão futura. Preços, disponibilidade e modelos podem mudar.
