O artigo detalha 12 áreas específicas onde o padrão da API compatível com OpenAI diverge entre diferentes motores de inferência e provedores hospedados, causando falhas silenciosas ou comportamento inesperado. Embora as formas básicas de solicitação e o streaming básico funcionem de forma confiável, diferenças sutis no tratamento de parâmetros, respostas de erro e suporte a recursos podem quebrar aplicações.

  • Parâmetros desconhecidos são frequentemente descartados silenciosamente em vez de rejeitados com um erro 400.
  • Modelos de raciocínio podem exigir `max_completion_tokens` em vez de `max_tokens`, com aceitação inconsistente.
  • Estatísticas de uso de tokens estão frequentemente ausentes nas respostas de streaming, a menos que solicitadas explicitamente via `stream_options`.
  • O suporte à chamada de ferramentas varia significativamente, com muitos servidores carecendo de chamadas paralelas nativas ou aderência estrita ao esquema.
  • As implementações do modo JSON diferem entre validação básica de objetos e decodificação restrita com esquemas.
  • O tratamento de estouro de contexto varia desde erros 400 rígidos até o truncamento silencioso dos prompts do sistema.
  • Os valores de `finish_reason` incluem adições específicas do provedor além do padrão stop, length e tool_calls.
  • Envelopes de erro e respostas de limitação de taxa (429, 503 ou 200 com erros no corpo) são inconsistentes.
  • Configurações de temperatura em modelos de raciocínio podem ser ignoradas internamente, apesar de serem aceitas.
  • O tratamento de entradas multimodais varia em limites de tamanho, tipos MIME e no parâmetro `detail`.
  • Endpoints de incorporação carecem de portabilidade devido à dimensionalidade e normalização diferentes.
  • Chaves de idempotência raramente são suportadas, e os cabeçalhos de ID da solicitação usam nomes inconsistentes.

O autor recomenda usar um script de teste para verificar a conformidade do provedor para esses comportamentos específicos, pois as versões dos modelos mudam com frequência e falhas silenciosas podem ser difíceis de depurar em produção.