A DeepSeek anunciou o V4-Flash-Vision-Exp, modelo multimodal experimental que mira o desempenho do Claude Opus 4.8 a custo menor. O detalhe relevante para quem tem produto em produção não é o benchmark, e sim que o preço do token da DeepSeek varia por hora do dia, com o pico custando cerca do dobro do vale. As janelas são definidas em Pequim e caem, no Brasil, entre 22h–01h e 03h–07h — ou seja, a madrugada, quando quase todo mundo agenda processamento em lote, é o horário caro. O ganho só existe para quem tem carga de lote relevante e consegue trocar de modelo sem refatorar.
- O preço do token na DeepSeek varia por hora: o pico custa cerca do dobro do vale.
- As janelas de pico são de Pequim e caem em 22h–01h e 03h–07h no Brasil — a madrugada é o horário caro.
- Só carga em lote se beneficia; chamada interativa acontece quando o usuário quiser.
- Se lote for menos de um terço da conta, isso não é prioridade — cache semântico rende mais.
- Os valores circulantes são de fonte secundária e a versão estável não foi confirmada: confira a tabela oficial.
O anúncio, e o que nele interessa
A DeepSeek apresentou o DeepSeek-V4-Flash-Vision-Exp, um modelo multimodal experimental que, segundo a empresa, se aproxima do desempenho do Claude Opus 4.8 a um custo bem menor. Como notícia de lançamento, é mais um item de uma lista longa demais para acompanhar.
O que interessa a quem tem produto rodando não é o benchmark. É uma característica da tabela de preços da DeepSeek que quase nenhuma cobertura menciona e que muda decisão de arquitetura: o preço do token varia conforme a hora do dia.
Token virou tarifa de energia elétrica
A conta deixa de ser “quanto custa mil tokens” e passa a ser “quanto custa mil tokens às três da tarde“. Segundo o levantamento do Beer And Code sobre os preços da V4, a diferença entre as duas janelas é de aproximadamente o dobro:
| V4-Pro (por milhão de tokens) | Vale | Pico |
|---|---|---|
| Entrada | ~US$ 0,44 | ~US$ 0,85 |
| Saída | ~US$ 0,87 | ~US$ 1,70 |
| Referência: Claude Opus 4.8 | US$ 5 entrada / US$ 25 saída | |
A V4-Flash segue a mesma lógica de dobrar no pico. Para quem só faz chamada interativa, isso é ruído. Para quem roda lote — geração de conteúdo, embeddings, classificação, reprocessamento —, é a diferença entre uma fatura e metade dela, sem trocar uma linha de código.
A pegadinha do fuso: o pico deles é a nossa madrugada
Aqui está o detalhe que inverte a intuição de todo mundo. As janelas de pico são definidas no horário de Pequim, e traduzidas para o Brasil elas caem assim:
| Pequim | Brasil | O que é |
|---|---|---|
| 9h–12h | 22h–01h | Pico (caro) |
| 14h–18h | 03h–07h | Pico (caro) |
| Demais horas | Manhã e tarde daqui | Vale (barato) |
Ou seja: a madrugada — onde praticamente todo mundo agenda job em lote — é o horário mais caro. E o horário comercial brasileiro, quando ninguém pensa em rodar processamento pesado, é o barato. É o oposto do reflexo herdado de infraestrutura, em que a madrugada sempre foi a janela ociosa.
Vale a distinção com o que já escrevemos: em o fuso brasileiro como vantagem off-peak o assunto era latência e disponibilidade nos fornecedores americanos. Aqui é outra coisa — é tarifa, e num fornecedor chinês. Os dois efeitos existem ao mesmo tempo e apontam para horários diferentes.
Mais barato só é mais barato para quem consegue trocar
A tabela acima não vale nada se o nome do modelo estiver espalhado por quarenta arquivos. É o mesmo ponto que levantamos ontem quando a OpenAI pausou o treinamento do Astra: preço e política do fornecedor mudam sem pedir licença, e quem não consegue trocar não se beneficia de nenhuma das duas coisas.
Antes de olhar preço de concorrente, o trabalho é o de sempre — e já tratamos dele em portabilidade entre modelos e em custo de tokens em produção.
O que fazer antes de mexer em qualquer coisa
# 1. Separe o que e INTERATIVO do que e LOTE.
# So o lote se beneficia de janela de preco.
# 2. Meca quanto do seu gasto e lote, em tokens/mes.
# Se for menos de um terco, isso aqui nao e prioridade.
# 3. Confira a tabela OFICIAL do fornecedor antes de agendar.
# Preco por horario muda, e fonte secundaria envelhece.
# 4. Antes de trocar de modelo, rode o SEU conjunto de casos.
# Benchmark publico nao responde pelo seu prompt.
# 5. Modelo marcado como experimental nao entra em producao
# sem plano de volta.O passo 2 é o que evita o erro mais comum: reescrever a arquitetura inteira para economizar em cima de um gasto que era pequeno. Se o grosso da sua conta é chamada interativa de usuário, o caminho é outro — cache semântico e redução de custo de API rendem mais.
O que não dá para concluir
Três ressalvas honestas. Primeira: os valores acima vêm de levantamento de terceiro, não da tabela oficial, e a versão estável com preço por janela ainda não foi confirmada pela empresa — confira antes de arquitetar em cima disso. Segunda: o modelo de visão é experimental, e experimental não tem compromisso de continuidade. Terceira: aproximar-se de um modelo em benchmark não é substituí-lo no seu caso — a única medição que decide isso é a sua, com os seus prompts.
Perguntas frequentes
Por que o horário de pico da DeepSeek cai na madrugada brasileira?
Porque as janelas são definidas no horário de Pequim — 9h às 12h e 14h às 18h por lá. Traduzido para o Brasil, isso vira 22h–01h e 03h–07h. O efeito prático é contraintuitivo: a madrugada, que na cultura de infraestrutura sempre foi a janela ociosa e barata, é justamente quando esse fornecedor cobra o dobro.
Vale a pena trocar de modelo só por causa do preço?
Só se você conseguir trocar. Se o nome do modelo está espalhado pelo código em vez de estar num arquivo de configuração, qualquer mudança vira refatoração de emergência e o desconto some no custo de engenharia. A ordem certa é centralizar primeiro, comparar depois.
Esses preços são oficiais?
Não. Os valores citados vêm de levantamento de terceiro, e a versão estável com cobrança por janela de horário ainda não foi confirmada pela empresa. Trate como indicação de que o mecanismo existe, não como tabela para orçar. Antes de mudar qualquer agendamento, confira na fonte oficial do fornecedor.
Isso contradiz o que vocês escreveram sobre o fuso brasileiro ser vantagem?
Não, são dois efeitos diferentes. Aquele texto tratava de latência e disponibilidade nos fornecedores americanos, onde trabalhar fora do pico dos Estados Unidos ajuda. Este trata de tarifa num fornecedor chinês, com janelas definidas em Pequim. Os dois existem ao mesmo tempo e apontam para horários diferentes — por isso a decisão depende de qual fornecedor você usa.






