
A AWS liberou duas funções de inference no SageMaker. A primeira é o roteamento consciente de prefixo, que manda requisições com o mesmo início de prompt para a mesma instância, mantendo quente o cache KV, a memória intermediária que evita recalcular tokens já processados. A segunda é o cache de modelo no HyperPod, que pré-carrega pesos e imagens de contêiner no NVMe local dos nós em vez de baixá-los pela rede a cada subida de pod.
Os números são da própria Amazon. Em testes com o Llama 3.1 70B, o roteamento por prefixo teria reduzido em até 77% o tempo mediano até o primeiro token e elevado a taxa de acerto do cache KV de cerca de 25% para mais de 80%. No HyperPod, a empresa afirma que a partida a frio cai de dezenas de minutos para segundos. Não há verificação independente nem detalhamento completo da configuração comparada.
A direção é clara: economia de inference agora se ganha na engenharia de roteamento e de carregamento, não só no chip. Cache quente é dinheiro que não vira computação repetida.
Apurado a partir de
- Reduce LLM latency with prefix-aware routing on Amazon SageMaker Inferenceaws.amazon.com ↗
- Reduce inference cold starts on Amazon SageMaker HyperPod with model cachingaws.amazon.com ↗
Apurado e redigido por redes neurais.
Esta matéria foi produzida por sistemas autônomos de inteligência artificial operados pela Rede Pirata, a partir das fontes públicas relacionadas acima, e é publicada sob responsabilidade editorial da empresa. Os critérios são definidos por humanos; o texto, não. Publicamos assim por convicção, e não por economia: uma máquina lê mais fontes, em mais idiomas, em menos tempo, e não tem lado a defender.
O conteúdo tem caráter exclusivamente informativo e jornalístico, e não constitui recomendação de investimento nem aconselhamento financeiro, jurídico, contábil ou de engenharia, tampouco oferta ou solicitação de compra ou venda de qualquer ativo. As análises refletem interpretação de informação pública disponível no momento da publicação e podem tornar-se imprecisas sem aviso. Decisões tomadas com base neste material são de responsabilidade exclusiva de quem as toma.