Web TippsUse custom web fonts in Google Sheets charts(08.09.2026 um 17:05 Uhr)
Web TippsIntroducing the new 1Password App for Google Chat(08.09.2026 um 18:02 Uhr)
Web TippsUse custom web fonts in Google Sheets charts(08.09.2026 um 17:05 Uhr)
Web TippsIntroducing the new 1Password App for Google Chat(08.09.2026 um 18:02 Uhr)

🔧 Programmierung 🕛 vor 2 Monaten 11 Min Lesezeit
0

Preço por token não é custo por tarefa: a inversão que muda a economia dos modelos de raciocínio

↗ Quelle (dev.to)
🗣️ Stimme:
📑 Inhaltsübersicht

Modelos aparentemente baratos podem consumir mais tokens, executar mais etapas e terminar com uma conta maior — especialmente em agentes de programação e outros fluxos de trabalho longos.



Uma API, ou interface de programação, permite que uma aplicação envie solicitações ao modelo e receba respostas. Normalmente, a cobrança considera tokens — pequenas unidades em que textos e códigos são divididos durante o processamento.



Em uma chamada simples, o custo pode ser representado aproximadamente por:







C=nentrada×pentrada+nsaıˊda×psaıˊda



Aqui, (n) representa o número de tokens consumidos e (p), o preço de cada tipo de token. O custo de inferência — isto é, de executar um modelo já treinado para produzir uma resposta — depende tanto do preço unitário quanto do volume consumido.



A tabela do fornecedor mostra principalmente o (p). Mas a aplicação paga por:



(p×n)



Nos modelos de raciocínio, a saída pode incluir tokens de pensamento: computação intermediária usada antes da resposta visível. Dependendo da API, esses tokens podem não aparecer para o usuário, embora sejam contabilizados e cobrados como tokens de saída. No conjunto avaliado pelo estudo, todos os fornecedores cobravam os tokens de raciocínio pela tarifa de saída.



Em sistemas com várias interações, a fórmula fica ainda mais extensa. É preciso contabilizar entradas novas, saídas, tokens de raciocínio, leituras e gravações de cache e o número de turnos executados. Cache de prompt é o mecanismo que reutiliza partes já processadas do contexto por um preço reduzido. Ele ajuda, mas não transforma históricos crescentes em consumo gratuito.






O que o estudo encontrou



Os pesquisadores avaliaram oito modelos de raciocínio em 12 conjuntos de tarefas: nove testes de turno único, envolvendo matemática, ciência, conhecimento, programação e chat, além de três ambientes com agentes capazes de usar ferramentas e interagir com sistemas ao longo de vários turnos. Entre os benchmarks estavam AIME, GPQA, LiveCodeBench, MMLU-Pro, GAIA, Cybench e Terminal-Bench 2.0.



Com oito modelos, existem 28 pares possíveis. Multiplicando-os pelas 12 tarefas, o estudo obteve 336 comparações. Em 106 delas — 32% — o modelo com menor preço listado produziu maior custo real. A maior inversão observada chegou a 28 vezes. ()






Custo sozinho também não escolhe o melhor modelo



O estudo mede gastos, mas não incorpora qualidade ao ranking principal. Além disso, utiliza um único nível de esforço de raciocínio por modelo e uma fotografia de preços registrada em 1º de maio de 2026. Os próprios autores reconhecem que mudanças de tarifa, configuração e qualidade podem alterar os resultados específicos.



A métrica mais útil para produção não é apenas custo por chamada, mas custo por resultado bem-sucedido:





Custo por sucesso=Nuˊmero de tarefas concluıˊdas corretamenteCusto total das execuc\co~es



Um modelo barato que falha e exige nova tentativa pode ser mais caro que um modelo premium que resolve o problema de primeira. Por outro lado, usar sempre o modelo mais sofisticado em tarefas triviais também desperdiça recursos.



A consequência natural é o model routing: direcionar cada solicitação ao modelo mais adequado à sua dificuldade, escalando para opções mais fortes quando necessário. O Reddit aponta exatamente esse dilema entre usar modelos fracos para problemas complexos e modelos caros para trabalhos simples. ()



The Price Reversal Phenomenon — versão 1 — Resumo original publicado em março de 2026. Usado para identificar a origem dos números “78% mais barato” e “22% mais caro” reproduzidos no Reddit. ()

Vollständiger Original-Bericht
Ausführliche Details, Code-Beispiele & Hersteller-Stellungnahme auf dev.to.
↗ Original-Artikel auf dev.to lesen
Wie bewertest du diesen Beitrag?
1 Klick Feedback
Teilen mit Netzwerk & Team:

Community-Analysen & Experten-Meinungen 0

Verfasse deine eigene Analyse, teile Workarounds oder diskutiere diesen Vorfall im Blog.
Noch keine Community-Analyse verfasst. Markiere einen Textabschnitt oder klicke oben auf Eigene Analyse verfassen“!
Community Pulse: Relevanz-Einschätzung
1 Klick Experten-Votum
🔴 Akute Relevanz 0%
🟡 In Evaluierung 0%
🟢 Keine Auswirkung 0%
Spannende Innovation 0%
Verwandte Story-Cluster & Quellen (Vektor-KI)
Port 8095 Engine
3 Quellen
Use custom web fonts in Google Sheets charts
2 Quellen
Introducing the new 1Password App for Google Chat
1 Quelle
Context-aware access controls are available for Gemini Enterprise in the Admin console
Ähnliche Beiträge
🔍 Verwandte News

Auch interessante Nachrichten Preço por token não é custo por tarefa: a inversão que muda a economia dos modelos de raciocínio

Thematisch verwandte Begriffe: Preço, token, custo, tarefa · 6 Treffer

Laden...

Videos werden geladen ...

Laden...

Beiträge werden geladen ...

Laden...

Videos werden geladen ...

Laden...

Beiträge werden geladen ...

Laden...

Videos werden geladen ...

Laden...

Beiträge werden geladen ...

Laden...

Videos werden geladen ...

Laden...

Beiträge werden geladen ...

Laden...

Videos werden geladen ...