Do token à cloud privada: por que razão a IA empresarial será híbrida

Conteúdos

Esta publicação surgiu de uma ideia de Javier Escribano que me parece especialmente acertada: a história do preço dos tokens compreende-se muito melhor se for vista como uma repetição da história da informática. Primeiro, havia mainframes extremamente caros nas mãos de muito poucos. Depois surgiu o time-sharing, ou seja, o pagamento por minutos de computação. Mais tarde, as empresas passaram a poder ter os seus próprios servidores. Depois surgiu o computador pessoal (PC). E, finalmente, o computador acabou por caber no bolso.

O paralelo com a IA é bastante evidente. Hoje, os grandes laboratórios funcionam como aqueles mainframes: infraestrutura muito cara, concentrada nas mãos de poucos e alugada por utilização. A unidade já não é o minuto de CPU, mas sim o token. A OpenAI, a Anthropic, a Mistral AI, a OpenRouter, a Google e outros fornecedores vendem acesso a modelos de ponta de uma forma muito semelhante à forma como se alugava capacidade de computação quando comprar um computador era impossível para quase todas as empresas.

A questão é saber se as empresas vão depender sempre desse esquema. Do ponto de vista da infraestrutura, a minha resposta é cada vez mais clara: não para tudo. Veremos um modelo híbrido em que os modelos de ponta continuarão a ser necessários para tarefas complexas, mas uma parte crescente do trabalho diário será executada em modelos de código aberto, modelos leves ou modelos especializados implementados em infraestrutura própria, cloud privada ou bare-metal gerido.

Do pagamento por token à infraestrutura própria para IA

Javier salienta que o preço dos tokens já está a cair rapidamente e lembra que o GPT-4 foi lançado em 2023 a 30 dólares por milhão de tokens iniciais, enquanto os modelos atuais equivalentes ou mais baratos se situam, em muitos casos, muito abaixo desse valor. Na sua opinião, o mercado está a tornar-se um bem de consumo, seguindo a mesma lógica que anteriormente se aplicou ao hardware.

Essa queda de preço altera o debate, mas não elimina o problema. Quando uma empresa dá os primeiros passos na IA, o custo por token costuma parecer suportável. Um projeto-piloto, alguns utilizadores, alguns fluxos internos. O problema surge quando a adoção cresce. Agentes que realizam iterações durante minutos, assistentes que lêem documentos longos, ferramentas que resumem chamadas, copilotos internos, processos de back-office, suporte, análise de registos, geração de relatórios. O token deixa de ser uma curiosidade e transforma-se numa rubrica orçamental significativa.

É aí que começa a mudança que já estamos a observar nos clientes e nas conversas sobre infraestrutura: «por que tenho de pagar pelo modelo mais caro para tarefas que não o exigem?». Muitas organizações não querem executar localmente toda a sua pilha de Inteligência Artificial. O que pretendem é deixar de enviar para modelos de ponta aquilo que pode ser resolvido por um modelo mais pequeno, mais barato e sob o seu controlo.

Não se trata de uma postura romântica a favor do código aberto. É uma decisão económica e operacional. Se uma tarefa for repetitiva, interna, previsível e não exigir o melhor raciocínio do mercado, faz sentido analisar se pode ser executada na própria infraestrutura. Se, além disso, envolver dados sensíveis, documentação interna ou requisitos de conformidade, o argumento ganha ainda mais força.

A Zylon é um bom exemplo desta tendência. A empresa apresenta a sua infraestrutura como uma solução de IA generativa privada e no local para setores regulamentados, com implementação na infraestrutura empresarial e sem dependência de uma cloud externa. Além disso, o seu PrivateGPT 1.0 define-se como uma camada de API de código aberto para construir aplicações privadas de IA em servidores de inferência locais ou auto-hospedados.

Mas esta tendência não se limita apenas à Zylon. Trata-se de uma transição mais ampla: passar de utilizar sempre API’s externas para conceber uma arquitetura de IA com vários níveis de computação.

A arquitetura vencedora será híbrida

A arquitetura mais adequada para muitas empresas não será «tudo na cloud» nem «tudo local». Será uma combinação das duas.

Os modelos de ponta continuarão a fazer sentido para tarefas de elevado valor: raciocínio complexo, planeamento, revisão crítica, geração avançada, problemas ambíguos ou fluxos em que a qualidade adicional compensa claramente o custo. Mas grande parte das aplicações empresariais não necessita do modelo mais potente em cada chamada.

É aí que entram os modelos de código aberto, os modelos pequenos, quantizados, especializados ou executados em infraestrutura própria. Também entram estratégias como separar a execução do critério: um modelo económico executa a maior parte do trabalho e um modelo superior intervém apenas como consultor quando há uma decisão difícil. A Anthropic já formalizou padrões deste tipo com a sua abordagem de «advisor», em que um modelo executor pode consultar um modelo mais capaz sem lhe ceder o controlo total do fluxo.

A questão não é escolher um modelo. É conceber uma política de utilização de modelos.

Na Ar, já vemos essa «transição para o servidor próprio» a partir da infraestrutura. Nem sempre significa comprar um equipamento físico para o instalar num escritório. Pode tratar-se de um ambiente de cloud privada, bare-metal, GPU dedicada, plataforma gerida, armazenamento isolado, rede privada e políticas de segurança adaptadas. O importante é que a empresa ganha capacidade de decisão: pode continuar a utilizar modelos externos quando estes acrescentam valor e executar em ambientes privados ou geridos as cargas de trabalho em que necessita de mais controlo, previsibilidade ou eficiência.

Essa mudança também obriga a ser honesto. Alojar IA internamente nem sempre é mais barato. Depende da utilização, da concorrência, do hardware, da operação, do modelo escolhido e do perfil da carga. Um trabalho recente sobre estimativa de custos em infraestrutura LLM alerta precisamente que assumir uma utilização fixa da GPU leva a grandes erros: com carga baixa ou média, o custo efetivo por milhão de tokens pode variar muito devido à subutilização.

Isto é importante porque evita cair no discurso simplista. Criar os seus próprios modelos pode poupar muito dinheiro se houver volume, estabilidade de carga e equipamento para o operar. Mas pode sair caro se for adquirido hardware que passa a maior parte do tempo inativo. O cálculo não é «API cara versus servidor gratuito». O cálculo real é o custo por tarefa útil, incluindo segurança, latência, manutenção, disponibilidade e evolução.

Onde ficará o valor

Se o padrão histórico se confirmar, os modelos generalistas tenderão a tornar-se um bem de consumo. Não desaparecerão. Pelo contrário, serão mais potentes e mais acessíveis. Mas será cada vez mais difícil construir uma vantagem sustentável baseada apenas no facto de «ter acesso a um modelo generalista». Esse acesso será garantido a todos.

O valor passará para os níveis superiores.

Estará nos dados próprios, na integração com processos reais, na experiência do utilizador, nos fluxos verticais, na segurança, na conformidade, na rastreabilidade, na capacidade de medir resultados e em saber que modelo utilizar, em que ambiente e para que carga.

Uma empresa não precisa de «IA» em abstrato. Precisa de reduzir os tempos de suporte, rever contratos, automatizar relatórios, acelerar o desenvolvimento, auditar configurações, apoiar os comerciais, ajudar os técnicos no terreno, analisar incidentes ou melhorar as decisões. Para isso, o modelo é apenas uma peça. A parte difícil é transformá-lo num produto, num processo e numa vantagem operacional, com uma arquitetura capaz de o sustentar.

É por isso que me interessa tanto o paralelismo do Javier. A história não diz que os grandes fornecedores vão deixar de ser importantes. A IBM não deixou de ser importante de repente quando surgiram servidores mais pequenos. As clouds públicas não deixaram de ser importantes quando as empresas continuaram a utilizar infraestruturas próprias. O que muda é a repartição.

A minha aposta é que, entre 2027 e 2030, muitas organizações irão descobrir que não precisam de enviar tudo para um modelo de fronteira. Irão utilizar os melhores modelos quando for vantajoso e executar muito mais trabalho em modelos próprios ou privados. A escolha do modelo deixará de ser uma decisão individual de cada utilizador para se tornar uma decisão de arquitetura.

Para muitas empresas, o desafio não será escolher entre modelos externos ou infraestrutura própria, mas sim conceber uma arquitetura híbrida que combine desempenho, controlo, segurança e eficiência em cada caso de utilização.

É por aí que as empresas devem começar já: inventariar utilizações, medir o consumo, classificar tarefas, separar dados sensíveis, testar modelos locais, avaliar custos reais e construir uma camada de gestão. Não para abandonar amanhã as APIs da OpenAI, da Anthropic, da Mistral AI ou do Google, mas para não depender delas em tudo.

O futuro não será deixar de pagar tokens. Será pagar tokens apenas onde fizer sentido.

Perguntas frequentes

Será que isto significa que as empresas deixarão de utilizar modelos de fronteira? Não. Os modelos de fronteira continuarão a ser úteis para tarefas complexas, raciocínio avançado e casos em que a qualidade compense o custo.

Quando faz sentido executar modelos em infraestrutura própria ou na cloud privada? Quando há volume suficiente, dados sensíveis, tarefas repetitivas, necessidade de controlo ou custos por token difíceis de justificar à escala.

Executar IA na infraestrutura própria é sempre mais barato? Não. Depende da utilização do hardware, da concorrência, da manutenção, do suporte, da energia, da segurança e da operação. É preciso medir o custo por tarefa, não apenas o preço por token.

Que papel terão os modelos de código aberto? Serão cada vez mais importantes para cargas internas, RAG privado, automatizações, assistentes especializados e tarefas que não requerem o modelo mais avançado.

Onde estará o valor se os modelos se tornarem um bem de consumo? Nas camadas verticais: dados próprios, integração com processos, segurança, experiência do utilizador, gestão, métricas e produtos específicos para setores específicos.

Fontes

Javier Escribano, a história ensina-nos qual será o preço dos tokens.

Zylon, infraestrutura privada de IA para setores regulamentados.

PrivateGPT, documentação sobre a sua camada de API local para aplicações privadas de IA.

Anthropic/Zylon, lançamento do PrivateGPT 1.0 e abordagem de backend privado de IA.

Chitral Patil, «Beyond Per-Token Pricing: A Concurrency-Aware Methodology for LLM Infrastructure Cost Estimation».

Tens curiosidade em explorar este tema com IA? Experimenta o ChatGPT ou o Perplexity.

Do token à cloud privada: por que razão a IA empresarial será híbrida 1

David Carrero

Se gostou, partilhe este artigo

Outros artigos

Contacte os nossos especialistas

Ar
Privacy Overview

Este site usa cookies para que possamos oferecer a melhor experiência possível ao utilizador. As informações dos cookies são armazenadas no seu navegador e desempenham funções como reconhecê-lo quando você volta ao nosso site e ajudar a nossa equipa a entender quais seções do site você acha mais interessantes e úteis.