A descodificação especulativa aumenta a inferência do MDI/CE, mas os métodos tradicionais requerem um modelo de rascunho separado e ineficiente. A Vertex AI usa o EAGLE-3, adicionando um pequeno cabeçalho de rascunho (2 a 5% do modelo de destino) às camadas internas, simplificando a preparação e alcançando uma aceleração da descodificação de ~2 a 3 vezes. Esta publicação descreve o nosso pipeline para limpeza de dados, incorporações, preparação e apresentação do EAGLE-3 com o SGLang no Vertex AI em grande escala.
[[["Fácil de entender","easyToUnderstand","thumb-up"],["Meu problema foi resolvido","solvedMyProblem","thumb-up"],["Outro","otherUp","thumb-up"]],[["Difícil de entender","hardToUnderstand","thumb-down"],["Informações incorretas ou exemplo de código","incorrectInformationOrSampleCode","thumb-down"],["Não contém as informações/amostras de que eu preciso","missingTheInformationSamplesINeed","thumb-down"],["Problema na tradução","translationIssue","thumb-down"],["Outro","otherDown","thumb-down"]],[],[],[]]