A OpenAI divulgou, em 25 de agosto, os primeiros números de desempenho do Jalapeño, seu primeiro chip próprio para inferência de IA, desenvolvido em parceria com a Broadcom. Segundo a empresa, o acelerador entrega até 1,9 vez mais capacidade de processamento por watt e reduz em até 3,6 vezes o tempo de resposta frente aos sistemas mais avançados que a Nvidia tem hoje em produção. Se os números se confirmarem fora do laboratório, o avanço pode pesar diretamente no custo de rodar modelos como o GPT-5.6 em escala — inclusive para empresas e desenvolvedores brasileiros que dependem da API da OpenAI.
O que é o chip Jalapeño
O Jalapeño foi apresentado publicamente em 24 de junho de 2026, quando OpenAI e Broadcom revelaram o projeto de um acelerador dedicado exclusivamente à inferência — ou seja, à etapa em que um modelo já treinado responde a pedidos dos usuários, e não ao treinamento em si. As duas empresas descreveram o chip como o primeiro processador de inteligência projetado em torno da visão da OpenAI para o futuro da inferência de LLMs, com o desenvolvimento concluído do design inicial ao tape-out de fabricação em cerca de nove meses — um ciclo considerado extremamente rápido para um semicondutor desse porte. Até então, o que existia eram amostras de engenharia rodando cargas de teste em laboratório; o anúncio de 25 de agosto é o primeiro a trazer números de desempenho medidos.
Os números do primeiro benchmark
Para validar o chip, a OpenAI usou o InferenceX, um conjunto de testes públicos voltado especificamente para cargas de inferência de modelos de linguagem, mantido pela consultoria de semicondutores SemiAnalysis. Os testes rodaram três modelos de tamanhos bem diferentes — GPT-OSS 120B, DeepSeek R1 670B e Kimi K2.5 1T — e compararam o Jalapeño a sistemas Nvidia GB200 e GB300, hoje as referências do mercado para inferência em grande escala.
Resultados por modelo
- GPT-OSS 120B: cerca de 1,9 vez mais capacidade de processamento por quilowatt frente a um sistema Nvidia GB200, segundo a OpenAI.
- DeepSeek R1 670B: 1,7 vez mais capacidade por quilowatt e latência até 3,6 vezes menor que um sistema Nvidia GB300.
- Kimi K2.5 1T (o maior modelo testado): cerca de 1,5 vez mais desempenho por watt e latência 3,4 vezes menor que o sistema de comparação.
Em cargas consideradas altamente interativas — casos em que a velocidade de resposta pesa mais do que o volume total processado —, a empresa registrou ganhos de 2,1 a 4,1 vezes. Richard Ho, chefe de hardware da OpenAI, resumiu o resultado à TechCrunch: os resultados mostram um avanço de desempenho muito, muito significativo sobre o estado da arte; o Jalapeño consegue processar mais trabalho de IA por unidade de energia, além de responder mais rápido.
Consumo de energia
O Jalapeño é especificado para operar a até 700 W, contra 1.200 W do GB200 e 1.400 W do GB300 — praticamente metade do consumo nominal dos concorrentes diretos. Nos testes divulgados, a OpenAI afirma que o consumo real sustentado ficou em 550 W ou menos. Vale o registro: esses são números autodeclarados pela própria OpenAI, ainda que obtidos com a metodologia de um benchmark de terceiros; não há auditoria independente publicada até o fechamento desta reportagem.
Os números de desempenho e consumo foram medidos e divulgados pela própria OpenAI, mesmo usando um benchmark público de terceiros (InferenceX, da SemiAnalysis). Trate como dado da empresa que fabricou o chip, não como validação externa independente.
Por que a OpenAI quer seu próprio chip
A motivação declarada é reduzir a dependência de um único fornecedor. A Nvidia continua concentrando a maior parte da capacidade de treinamento e inferência de IA do mundo, o que expõe empresas como a OpenAI a filas de espera, preços mais altos e risco de fornecimento. O Jalapeño ataca especificamente a inferência — a fatia do custo operacional que cresce a cada conversa, sugestão de código ou resposta de agente gerada para os usuários —, enquanto o treinamento dos modelos maiores deve continuar dependendo de GPUs da Nvidia e de outros fornecedores por enquanto.
O movimento não é exclusivo da OpenAI. A Anthropic montou uma equipe própria de design de chips e fechou um acordo bilionário com a Broadcom para garantir cerca de 1 milhão de unidades da TPU v7p do Google até o fim de 2026, segundo reportagens da Forbes e da TechWireAsia. Google, Amazon e Microsoft já têm seus próprios aceleradores (TPU, Trainium e Maia, respectivamente) há anos, e a Meta segue caminho parecido com o MTIA. Em comum, nenhuma dessas empresas abandonou a Nvidia — todas seguem comprando GPUs em volume —, mas todas querem ter uma alternativa própria para não depender de um único fornecedor. Esse pano de fundo ajuda a explicar por que infraestrutura de nuvem virou tema central em comparações como a que fizemos entre [AWS, Azure e Google Cloud](/artigo/aws-vs-azure-vs-gcp-2026): cada provedor está apostando peso em silício sob medida.
Quando o chip entra em operação
Segundo a OpenAI, a implantação do Jalapeño dentro da própria infraestrutura da empresa começa ainda em 2026, em volume pequeno, com expansão mais substancial prevista para 2027. A empresa afirma que vai continuar usando aceleradores da Nvidia e de outros fornecedores em paralelo — não se trata de uma substituição, e sim de mais uma opção na composição de hardware que atende ao ChatGPT, à API e às ferramentas de desenvolvimento da empresa.
O que isso significa para quem desenvolve com IA no Brasil
Para times técnicos brasileiros que já usam a API da OpenAI, o benefício direto ainda não está definido: a empresa não anunciou nenhum corte de preço vinculado ao Jalapeño, nem prazo para isso acontecer. O que existe, por ora, é um sinal de que o custo por token e a latência de resposta — dois fatores que pesam direto na conta de quem roda produtos como chatbots, assistentes de código ou [agentes que usam o botão Think do GPT-5.6](/artigo/chatgpt-guia-gpt-5-6-botao-think) — têm espaço para melhorar sem depender só de mais GPUs da Nvidia no mercado. Quem acompanha de perto o consumo de tokens da própria aplicação pode usar a [calculadora de tokens e custo de IA](/calculadora-tokens) do Bytezine para simular como uma eventual queda no preço por token afetaria o orçamento do projeto.
A repercussão no Brasil já apareceu em veículos como Tecnoblog e Canaltech, que noticiaram o benchmark no mesmo dia da divulgação — sinal de que o tema interessa além do público de infraestrutura pura. Vale a ressalva de sempre: são números de laboratório, divulgados pela própria empresa que fabricou o chip. A validação real vem quando o Jalapeño estiver rodando tráfego de produção em volume, o que só deve acontecer, segundo o cronograma da OpenAI, ao longo de 2027.
Ainda que o Jalapeño não vá substituir a Nvidia da noite para o dia, o anúncio confirma um movimento que já vinha se desenhando: a corrida por eficiência energética na inferência de IA entrou de vez para a lista de prioridades das grandes empresas de tecnologia, ao lado da corrida por modelos mais capazes, como os da [família GPT-5.6](/artigo/gpt-5-6-o-que-muda-no-dia-a-dia). Para quem constrói produtos sobre essas plataformas, o desdobramento a acompanhar não é o chip em si, mas se — e quando — essa eficiência vai aparecer na fatura da API.
Perguntas frequentes
É o primeiro chip próprio da OpenAI, desenvolvido em parceria com a Broadcom e apresentado publicamente em junho de 2026. Foi projetado especificamente para inferência — a etapa em que um modelo de IA já treinado responde a pedidos dos usuários — e não para o treinamento de novos modelos.