EN FR ES PT DE AR 中文

O Penhasco do Subsídio de IA: A Conta Real da Inferência Chegou

Assinaturas de IA com taxa fixa foram precificadas para conquistar clientes, e alguém cobriu a diferença. À medida que a faturação muda para tokens e as renovações mordem, os compradores empresariais estão prestes a encontrar o custo verdadeiro.

Alguém esteve pagando sua conta de IA, e nunca foi sua equipe financeira. Por três anos, a indústria vendeu inteligência de frontier a preços que não tinham nada a ver com o custo, porque quem passava o cartão não era a pessoa usando o produto. Esse arranjo tem um nome em qualquer outro mercado: um subsídio. Subsídios acabam. O penhasco do subsídio de IA é o que os orçamentos empresariais atingem quando este termina, e a lacuna entre o que a IA custa e o que você esteve pagando por ela é a história de 2026.

A pergunta útil não é se os fornecedores vão repricificar, porque isso já está em andamento. As perguntas úteis são quão longe os números reais estão dos que estão na sua fatura e o que sobrevive à correção.

Quanto custa realmente executar IA?

Comece com a melhor medição disponível. A SemiAnalysis comprou todos os tiers de IA de consumo e rodou cada um até seu limite semanal em codificação de longo horizonte e trabalho agentivo, e seu teste de estresse de assinatura produziu um número agora citado em todos os lugares: um plano ChatGPT Pro de $ 200 totalmente usado, valificado às taxas de API publicadas, custaria até $ 14.000 por mês. Setenta vezes entre o preço de etiqueta e o valor de lista. Medido contra o custo verdadeiro de servir, que a mesma análise coloca perto de um quarto do preço de lista, um usuário máximo queima aproximadamente $ 3.500 de computação contra $ 200 de receita: uma lacuna de 17,5 vezes na leitura generosa.

Não há escândalo em nada disso; o design funcionou como pretendido. Uma assinatura de $ 200 era um orçamento de aquisição de clientes com uma API anexada, e cada usuário pesado era uma pequena perda entusiasta.

Siga o mecanismo: quem estava pagando e por que pararam

Os preços devem carregar informações sobre o custo. Estes não carregavam nenhuma, porque o comprador e o pagador eram pessoas diferentes. O pagador eram os mercados de capitais. David Cahn, da Sequoia, fez a aritmética cedo. Sua pergunta de $ 200 bilhões perguntou de onde viria realmente a receita para justificar o gasto em infraestrutura de IA, e em junho de 2024 a lacuna triplicou para sua pergunta de $ 600 bilhões, com a implantação de capital superando todo caminho de receita credível. A escala dessa implantação é pública: somente a Microsoft disse que estava a caminho de gastar aproximadamente $ 80 bilhões em datacentres de IA em um único ano fiscal.

Jogos free-to-play rodam nesta economia. Um punhado de baleias financiam o lobby, e todos os outros jogam nos seus cartões de crédito. A IA empresarial inverteu isso: as baleias eram fundos de venture capital e balanços de big-tech, e toda a indústria jogou de graça. A diferença é que jogos conseguem manter suas baleias. O nosso tem relatórios trimestrais, obrigações de serviço e, eventualmente, mercados públicos para enfrentar. Investidores subsidiarão adoção. Eles não subsidiarão hábito.

Visto dessa forma, o chatbot era a embalagem e o subsídio era o produto. Uma vez que você aceita isso, as notícias de preços do ano param de parecer uma série de decisões isoladas.

A carga de trabalho quebrou o preço primeiro

O preço de taxa fixa sobreviveu enquanto a carga de trabalho era chat: prompts curtos, respostas curtas, médias previsíveis. Então a indústria lançou agentes, e as médias ficaram ferais. Uma sessão de codificação agentiva planeja, lê arquivos, escreve patches, roda testes e faz loops; uma única tarefa pode queimar aproximadamente mil vezes os tokens de uma resposta de chat, e modelos de frontier gastarão mais de 100.000 tokens de saída antes de pararem. Os fornecedores entenderam a matemática cedo, é por isso que as próprias páginas de plano do GitHub agora precificam uso agentivo pesado em 'solicitações premium' medidas, cobradas por solicitação além da allowance mensal. Preço tudo-o-que-pode-comer está bem quando clientes pedem a salada. Quebra quando eles contratam a cozinha.

A primeira grande vítima chegou em abril de 2026, quando a Microsoft pausou novas inscrições para os tiers de estudante e individual do GitHub Copilot após custos operacionais quase dobrarem em um trimestre. O rastro público passa pelo changelog do próprio Copilot do GitHub: limites de taxa apertados, allowances formalizados, faturação direcionada para tokens.

Observe a forma dessa resposta: nenhum press release anunciando um aumento. Quando um fornecedor muda a unidade de faturação, a unidade é o aumento. A cobrança por tokens repricifica seus usuários mais pesados primeiro e move silenciosamente o risco de custo do P&L do fornecedor para o seu orçamento.

As alegações de produtividade nunca foram medidas

A correção não diz nada sobre se as ferramentas funcionam. Diz que ninguém as mediu corretamente enquanto a computação era grátis, e a medição mais honesta até hoje é awkward para todos. Quando a METR rodou um teste randomizado com desenvolvedores open-source experientes, a assistência de IA os tornou 19% mais lentos enquanto eles acreditavam estar 20% mais rápidos. Um estudo, um setting, mas permanece o único número do seu tipo, e mostra o quão pouco a indústria sabe sobre seu próprio produto. Benchmarks de fornecedores medem o que lisonjeia: taxas de aprovação em tarefas curadas, velocidade em código greenfield. O número que um comprador realmente precisa, custo por tarefa concluída, quase nunca aparece no deck de vendas.

Uma ferramenta que economiza uma hora de um desenvolvedor enquanto queima £ 40 de computação subsidiada é uma compra. A mesma ferramenta ao custo verdadeiro de servir é uma diferente, e nenhuma observação diz que a ferramenta é inútil. O que elas dizem é que o caso de negócio foi escrito com o dinheiro de outra pessoa. Se um déficit de produtividade existe, ele vive na contabilidade antes de viver nos modelos.

Executar seus próprios modelos é mais barato?

A saída de escape óbvia é mais estreita do que parece. Modelos open-weight cortam a conta por token a zero e adicionam hardware, energia e manutenção no lugar. Precifique taxas de GPU sob demanda publicadas contra a carga de trabalho de uma pequena equipe e a conta da API geralmente ganha, particularmente nas tarefas de longo contexto que agentes precisam. Auto-hospedagem compra controle, residência de dados e independência do humor de preços de um fornecedor. Não compra o subsídio de volta. Se seu plano para o penhasco é 'vamos apenas rodar pesos abertos', precifique a conta de energia antes de precificar a liberdade.

Onde o penhasco do subsídio de IA deixa os orçamentos empresariais

Três consequências se seguem. Nenhuma é opcional.

Primeiro, procurement muda de medo de ficar de fora para aritmética. Cada renovação nos próximos dezoito meses é um evento de repricificação, então entre com seus próprios dados de uso e negocie por custo por tarefa concluída em vez de preço por assento. Um benchmark sem uma coluna de custo é um anúncio.

Segundo, eficiência se torna uma disciplina de engenharia novamente. Orçamentos de tokens, roteamento de modelos, caching, modelos menores para tarefas menores: os ofícios sem glamour que o subsídio tornou opcionais agora separarão equipes que medem de equipes que chutam. Se seu uso de IA não tem medição, corrigir isso é uma questão de readiness de IA antes de ser uma questão de ferramenta. Sistemas agentivos em particular precisam de governança e observabilidade construídos dentro em vez de aparafusados fora, que é toda a premissa de projetar sistemas agentivos seguros.

Terceiro, espere consolidação. Fornecedores cuja economia unitária fecha em preços honestos sobreviverão, porque a demanda é real. Fornecedores cujo crescimento dependeu do subsídio são comprados, fundidos ou repricificados para respeitabilidade. Nenhuma profecia é necessária aqui; o mecanismo apenas aponta uma direção.

Nada disso faz da IA uma bolha no sentido usual. Os modelos são genuinamente úteis; a dúvida sempre esteve anexada ao preço. Por três anos o subsídio foi o produto, a renovação é a fatura, e este é o ano em que se encontram. Orçamente para o modelo que você pode affordar ao custo, não o demo que você foi mostrado com prejuízo. Uma estratégia técnica que precifica inferência honestamente durará mais que qualquer relatório de benchmark.

Perguntas frequentes

Quando os preços de IA aumentarão para compradores empresariais?

Eles já estão, mas através de mecanismo em vez de anúncio: tiers de taxa fixa estão sendo aposentados, limites de taxa apertados e faturação movida para tokens, o que repricifica os usuários mais pesados primeiro. Trate cada renovação de 2026 em diante como um evento de repricificação e negocie por custo por tarefa concluída, não preço por assento.

Quanto custa realmente executar IA em utilização total?

O teste de estresse da SemiAnalysis descobriu que um plano ChatGPT Pro de $ 200 totalmente usado custaria até $ 14.000 por mês nas taxas de API publicadas, e aproximadamente $ 3.500 contra o custo de servir estimado. A lacuna entre o preço da assinatura e a computação consumida fica entre 17x e 70x dependendo de como você mede.

Auto-hospedagem de modelos open-source é mais barata que pagar por APIs de IA?

Geralmente não na frontier. O custo por token cai a zero, mas hardware, eletricidade e manutenção frequentemente excedem a conta da API, especialmente para tarefas de longo contexto que agentes de codificação precisam. Auto-hospedagem compra controle e residência de dados; não recria o subsídio.

Relacionado

Escrito por uma persona editorial de IA do sistema editorial proprietário da Abyshire e revisto pela nossa equipa.