OpenAI
Esta página foi traduzida automaticamente. Ver o artigo original em inglês.

Guia de faturação da API de Reinforcement Fine-Tuning

Como funciona a faturação da API de RFT

Atualizado: 6 days ago

Como funciona a faturação do RFT

A Afinação por Reforço (RFT) permite otimizar o desempenho dos modelos de raciocínio da OpenAI através de aprendizagem por reforço. Ao contrário das nossas ofertas de afinação supervisionada ou por preferências, que são faturadas pelo número de tokens no conjunto de dados de treino, o RFT é faturado com base no tempo que a sua execução de treino dedica ao trabalho central de aprendizagem automática.

Este guia explica o que conta como tempo de treino faturável, como tratamos pausas e cancelamentos, e como as suas escolhas de configuração podem afetar o custo.

Preços

  • Computação: $100 por hora de tempo real decorrido no ciclo de treino principal do o4-mini-2025-04-16. Os encargos são calculados proporcionalmente ao segundo e arredondados a duas casas decimais na fatura (por exemplo, 2,55 horas).

  • Utilização de modelos avaliadores: se utilizar um modelo da OpenAI para «avaliar» resultados durante o treino, os tokens consumidos por essas chamadas de avaliação são faturados separadamente, de acordo com as nossas tarifas padrão da API, após a conclusão do treino.

Apenas cobramos o trabalho de treino que atualiza efetivamente o seu modelo (aquilo a que chamamos «progresso efetivo registado»).

O que faturamos

Faturamos o tempo que o seu worker de treino passa a treinar ativamente o seu modelo, especificamente:

  • Gerar amostras a partir do seu modelo durante o processo de afinação (conhecidas como «rollouts»)

  • Avaliar esses resultados com um ou mais avaliadores que definiu na tarefa (saiba mais sobre avaliadores)

  • Calcular e aplicar atualizações de pesos com base nas notas (retropropagação).

  • Executar quaisquer passos de validação (avaliação) que tenha configurado.

A maioria dos avaliadores é «gratuita» de executar, o que significa que não cobramos extra pela sua utilização fora do tempo que contribuem para o ciclo principal de treino. A exceção são os avaliadores de modelo, para os quais também contabilizamos os tokens que esses avaliadores consomem durante as atividades acima. Estes tokens aparecem como um item de linha separado na sua fatura. Os tokens consumidos por avaliadores de modelo são faturados às tarifas normais de inferência (preços da OpenAI).

O que NÃO faturamos

Não cobramos o tempo gasto em:

  • Validar ou inspecionar o seu conjunto de dados antes do início do treino.

  • Verificações de segurança ao seu conjunto de dados.

  • Esperar numa fila por recursos computacionais.

  • Transferir pesos do modelo ou conjuntos de dados.

  • Preparar (renderizar) o seu conjunto de dados para o nosso formato de treino.

  • Avaliações de segurança pós-treino do seu modelo ajustado.

Se o trabalho de treino se perder devido a um erro do nosso lado (por exemplo, se um worker falhar e tiver de recuar para um checkpoint anterior), não lhe será cobrado o tempo de computação perdido nem os tokens dos avaliadores. Mais detalhes sobre isto na secção seguinte.

Progresso útil capturado e eventos de faturação

O treino consiste em muitas pequenas atualizações ao seu modelo. Acompanhamos quantas dessas atualizações são concluídas com sucesso. As cobranças baseiam-se no tempo de computação e nos tokens dos avaliadores associados a estas atualizações bem-sucedidas.

Emitimos uma cobrança quando ocorre um dos seguintes “eventos de faturação”:

  • O treino é concluído com sucesso.

  • Coloca o treino em pausa.

  • Cancela o treino.

  • O treino falha.

Cada cobrança abrange o trabalho incremental realizado desde a última cobrança. Por exemplo:

  • Se colocar uma execução em pausa, guardamos um checkpoint e cobramos-lhe o tempo de computação e os tokens dos avaliadores usados desde a última cobrança.

  • Quando retoma, o treino continua a partir do checkpoint. A cobrança seguinte (na conclusão, noutra pausa, cancelamento ou falha) abrangerá apenas o trabalho adicional realizado após a retoma.

  • Se cancelar uma execução, cobramos-lhe o trabalho realizado até ao cancelamento.

  • Se o treino falhar e se perder trabalho desde a última cobrança, essa parte perdida não lhe será faturada.

Esta abordagem de “progresso útil capturado” garante que só paga pelo trabalho que é mantido no seu modelo ou que abandona intencionalmente.

Ver o progresso da tarefa

As tarefas de RFT têm um campo denominado usage_metrics, que regista a utilização total da tarefa até ao passo atual. Este valor inclui o tempo de treino e todos os tokens utilizados por todos os modelos avaliadores na tarefa. Este campo pode ser consultado através da API (GET /v1/fine_tuning/jobs/{job_id}) ou do painel de ajuste fino.

Fatores que influenciam o tempo de treino

Uma vez que a faturação se baseia no tempo, as opções de configuração afetam diretamente o custo. Os principais fatores incluem:

  • Dificuldade dos problemas: se o seu conjunto de dados tiver problemas difíceis, é provável que o modelo dedique mais tempo ao raciocínio sobre cada problema, aumentando o tempo necessário para produzir cada amostra.

  • Intensidade computacional: o hiperparâmetro compute_multiplier controla a quantidade de computação realizada em cada passo do treino. Valores mais elevados incentivam o modelo a raciocinar mais extensamente sobre cada ponto de dados, tornando cada passo mais lento.

  • Definições de validação:

  • Desempenho dos avaliadores:

  • Os modelos avaliadores maiores ou mais avançados demoram mais tempo a devolver uma avaliação do que os modelos menores. Por exemplo, avaliar com um modelo de raciocínio pode demorar 10 vezes mais do que com um modelo sem raciocínio.

  • As funções de avaliação complexas em Python demoram mais tempo a executar do que as funções simples.

Estas definições permitem equilibrar o custo, a rapidez e a qualidade do modelo. Por exemplo, uma validação frequente permite detetar problemas mais cedo, mas aumenta o custo. A avaliação com um modelo mais avançado pode melhorar drasticamente a sua precisão, mas torna cada passo de avaliação mais lento e as tarefas mais dispendiosas.

Gerir os custos

Para controlar as despesas:

  • Comece com execuções mais curtas para perceber como a sua configuração afeta o tempo.

  • Utilize um número razoável de exemplos de validação e de eval_samples. Evite fazer validações com mais frequência do que o necessário.

  • Escolha o modelo avaliador mais pequeno que cumpra os seus requisitos de qualidade.

  • Mantenha eficientes os avaliadores Python personalizados.

  • Ajuste compute_multiplier para equilibrar a velocidade de convergência e o custo.

  • Acompanhe a execução no painel ou através da API. Pode colocar em pausa ou cancelar a qualquer momento.

Exemplos

Execução de treino bem-sucedida

Tempo de treinoTempo faturadoEstadoDescrição
00:0000:00O utilizador cria uma tarefa de RFT via API
00:1000:00VALIDATING_FILES10 minutos gastos a validar o conjunto de dados
00:3000:00VALIDATING_FILES20 minutos a executar verificações de segurança do conjunto de dados
01:0000:00QUEUED30 minutos à espera de um worker disponível
01:3000:00RUNNING30 minutos a configurar o treino (transferência de pesos, pré-processamento, etc.)
05:3004:00RUNNING4 horas gastas em treino
06:0004:00RUNNING30 minutos a executar avaliações de segurança do modelo resultante
06:0004:00SUCCEEDEDO treino termina

Neste caso, o tempo total de relógio é de 6 horas, mas apenas 4 horas são faturáveis. O custo seria 4 horas × $100/hora = $400.

Exemplo de tarefa falhada

Neste exemplo, a execução treina durante 2 horas, escreve um checkpoint, treina durante mais 1 hora, mas depois falha. Apenas as 2 horas de treino até ao checkpoint são faturáveis.

Tempo de treinoTempo faturadoEstadoDescrição
00:0000:00O utilizador cria uma tarefa de RFT via API
00:1000:00VALIDATING_FILES10 minutos gastos a validar o conjunto de dados
00:3000:00VALIDATING_FILES20 minutos a executar verificações de segurança do conjunto de dados
01:0000:00QUEUED30 minutos à espera de um worker disponível
01:3000:00RUNNING30 minutos a configurar o treino (transferência de pesos, pré-processamento, etc.)
03:3002:00RUNNING2 horas gastas em treino
03:3002:00RUNNINGCheckpoint criado no passo 5
04:3002:00RUNNINGO treino falha devido a erro interno no passo 8 (após mais 1 hora)
04:3002:00RUNNING30 minutos a avaliar e validar o checkpoint
04:3002:00SUCCEEDEDA tarefa termina (com o checkpoint mais recente)

Embora tenham sido gastas 3 horas em treino no total, apenas 2 horas são «capturadas» num checkpoint utilizável e são faturadas. A hora de trabalho de treino perdida devido à falha não é da sua responsabilidade. O custo seria 2 horas × $100/hora = $200.

Perguntas frequentes

Quando é feita a cobrança?

A cobrança é feita quando a execução termina, é colocada em pausa, é cancelada ou falha. Cada cobrança abrange o trabalho realizado desde a cobrança anterior.

Pago se uma execução falhar?

Se uma execução falhar devido a um erro nosso e algum trabalho de treino recente se perder, não lhe é cobrada a parte perdida. Se cancelar uma execução, é-lhe cobrado o trabalho realizado até ao cancelamento.

Como são faturados os tokens dos modelos avaliadores?

Contamos os tokens usados por quaisquer avaliadores de modelo que configurar. Depois de o treino terminar, faturamos esses tokens às nossas tarifas padrão por token.

Posso pausar e retomar uma execução?

Sim. Quando pausa, guardamos um checkpoint e cobramos o trabalho realizado até então. Quando retoma, só lhe será cobrado o trabalho adicional realizado depois de retomar.

Se tiver outras perguntas sobre a faturação da Reinforcement Fine‑Tuning, contacte a nossa equipa de apoio.

Este artigo foi útil?