Back to posts
Tech

GLM. 5.1 Roda por 8 Horas. Melhora a Cada Minuto.

A maioria dos modelos de IA atinge um teto rapidamente: aplica técnicas conhecidas, ganha desempenho inicial e para. O GLM. 5.1 foi construído para não parar. Quanto mais tempo ele roda, mais longe el

Swipe →
GLM. 5.1 Roda por 8 Horas. Melhora a Cada Minuto.

A maioria dos modelos de IA atinge um teto rapidamente: aplica técnicas conhecidas, ganha desempenho inicial e para. O GLM. 5.1 foi construído para não parar. Quanto mais tempo ele roda, mais longe ele chega. O GLM. 5.1 rodou 655 iterações sozinho e superou o Claude Opus 4.6 por 6x no VectorDBBench.

A maioria dos modelos de IA atinge um teto rapidamente: aplica técnicas conhecidas, ganha desempenho inicial e para. O GLM. 5.1 foi construído para não parar. Quanto mais tempo ele roda, mais longe ele chega. O GLM. 5.1 rodou 655 iterações sozinho e superou o Claude Opus 4.6 por 6x no VectorDBBench.

O que o GLM. 5.1 muda de verdade

O resumo em 3 pontos

No benchmark VectorDBBench, o GLM. 5.1 recebeu um esqueleto em Rust com stubs vazios e autonomia total para editar código, compilar, testar e perfilar. O melhor resultado anterior, obtido pelo Claude Opus 4.6, era de 3.547 QPS em uma sessão de 50 turnos. O GLM. 5.1 rodou 655 iterações com mais de 6.000 chamadas de ferramenta e identificou seis gargalos estruturais distintos, incluindo roteamento hierárquico via super. clusters e quantização via VNNI. O resultado final foi 21.500 QPS, aproximadamente seis vezes o melhor resultado de sessão única.

21.500 QPS: Como o Modelo Otimizou um Banco de Dados Sozinho

No KernelBench Nível 3, o desafio é produzir kernels de GPU mais rápidos que a implementação de referência em PyTorch para arquiteturas completas como MobileNet, VGG, MiniGPT e Mamba. Cada problema roda em um container Docker isolado com uma GPU H100, limitado a 1.200 turnos de uso de ferramentas. O GLM. 5 melhorava rápido mas plateiava cedo, atingindo 2,6x de speedup. O GLM. 5.1 sustentou a otimização muito além dos 1.000 turnos, alcançando 3,6x de speedup geométrico médio nos 50 problemas, enquanto o Claude Opus 4.6 lidera com 4,2x mas ainda mostra que o horizonte produtivo aberto é o novo campo de batalha.

1.700 Passos de Agente: Kernels de GPU e Engenharia de Longa Duração

O terceiro cenário não tinha métrica numérica: construir um ambiente desktop estilo Linux como aplicação web, sem código inicial, sem mockups, sem orientação intermediária. Modelos anteriores produzem um esqueleto básico com uma taskbar estática e param. O GLM. 5.1 foi envolvido em um loop simples que, após cada rodada, revisa o próprio output, identifica o que pode melhorar e continua. Em 8 horas de execução contínua, o modelo entregou um ambiente completo com explorador de arquivos, terminal, editor de texto, monitor de sistema, calculadora e jogos, tudo integrado em uma UI visualmente consistente rodando no browser. O modelo não declarou a tarefa completa; ele continuou refinando até o tempo acabar.

Desktop Linux no Browser: 8 Horas Sem Parar

O GLM. 5.1 redefine o que um modelo open. source pode fazer dado tempo suficiente. Aqui estão as ações concretas para aproveitar isso agora:

O que isso significa para devs e pesquisadores

  O GLM. 5.1 redefine o que um modelo open. source pode fazer dado tempo suficiente. Aqui estão as ações concretas para aproveitar isso agora:🔓