Pular para o conteúdo

Apresentando o Rogue Deep Think

O modelo mais poderoso da Rogue para engenharia de software. Ainda em medium effort, o Preview fez 75,22% no DeepSWE v1.1 e 36,78% no FrontierSWE v2.

DeepSWE v1.175,22%Acima de todos os resultados do placar públicoAvaliação interna · medium effort

Hoje apresentamos o Rogue Deep Think (Preview), o modelo mais poderoso da Rogue para engenharia de software. Ele parte do GLM 5.3 e dedica mais raciocínio e mais verificação a cada tarefa antes de entregar a resposta.

Nesta primeira versão, medida em medium effort, o Preview fez 75,22% no DeepSWE v1.1 e 36,78% no FrontierSWE v2. No DeepSWE, a pontuação passa de todos os resultados publicados no placar público do benchmark, cujo maior valor hoje é 74,12%.

Os resultados

Os dois números vêm das nossas avaliações internas. Em relação à base interna de cada benchmark, o Preview subiu 6,19 pontos percentuais no DeepSWE, de 69,03% para 75,22%, e 6,60 pontos no FrontierSWE, de 30,18% para 36,78%.

Rogue Deep Think (Preview), medido em medium effort: 75,22% no DeepSWE v1.1, 6,19 pontos acima da base interna, e 36,78% no FrontierSWE v2, 6,60 pontos acima da base interna.Rogue Deep Think (Preview), medido em medium effort: 75,22% no DeepSWE v1.1, 6,19 pontos acima da base interna, e 36,78% no FrontierSWE v2, 6,60 pontos acima da base interna.
Os dois resultados do Preview e o ganho sobre a base interna de cada benchmark.Baixar PNG 4K Baixar PNG 4K

Por que DeepSWE e FrontierSWE

Durante anos, o placar mais citado em programação foi o SWE-bench Verified. Em fevereiro de 2026, a OpenAI deixou de divulgá-lo e pediu aos outros laboratórios que fizessem o mesmo. Todos os modelos de ponta que ela testou já tinham visto parte das soluções no treino, e 59,4% dos 138 problemas difíceis que auditou tinham defeito no teste ou na descrição. Em julho, a OpenAI retirou também a recomendação do SWE-bench Pro, que tinha sugerido no lugar, ao estimar que cerca de 30% das tarefas estavam quebradas.

O DeepSWE, da Datacurve, foi desenhado para evitar esses dois problemas. As 113 tarefas, em 91 projetos de código aberto e cinco linguagens, foram escritas do zero e nunca enviadas aos repositórios originais, para que nenhum modelo tenha visto a resposta no treino. Cada uma é corrigida por um verificador escrito à mão, que testa o comportamento do programa e não detalhes de implementação. Uma solução de referência adiciona em média 668 linhas de código, contra 120 no SWE-bench Pro. Nos lançamentos de julho a setembro de 2026, o DeepSWE aparece nos materiais de OpenAI, Anthropic, Google, xAI, Z.ai, Moonshot e DeepSeek.

O FrontierSWE, da Proximal, mede trabalho ainda mais longo. São 34 tarefas de engenharia e pesquisa, como decodificar fala a partir de sinais do cérebro, treinar modelos de previsão do tempo e reimplementar em Rust o núcleo do Quantum ESPRESSO. Cada tentativa tem até 20 horas, cada tarefa roda cinco vezes, e os autores dizem que o benchmark está longe de saturar: o maior resultado público é 65,51%.

O que isso muda

Como cada tarefa do DeepSWE é uma mudança grande em um projeto real, errar menos pesa. Com o modelo de base, 31 de cada 100 tentativas falhavam. Com o Preview, 25. Uma em cada cinco tentativas que falhavam passa a dar certo.

Tentativas que falham no DeepSWE v1.1, a cada 100: 30,97 com a base interna do GLM 5.3 e 24,78 com o Rogue Deep Think (Preview), 20% a menos.Tentativas que falham no DeepSWE v1.1, a cada 100: 30,97 com a base interna do GLM 5.3 e 24,78 com o Rogue Deep Think (Preview), 20% a menos.
Tentativas que falham no DeepSWE v1.1, a cada 100: uma em cada cinco falhas passa a dar certo.Baixar PNG 4K Baixar PNG 4K

Mais raciocínio, mais acerto

Medimos o Preview em configurações com intensidade de raciocínio crescente. Nos dois benchmarks, a pontuação sobe a cada passo, da base interna até a configuração que reportamos.

Gráfico do DeepSWE v1.1 por intensidade de raciocínio: base interna em 69,03%, depois 72,05%, 72,23% e 75,22% na configuração do Preview.Gráfico do DeepSWE v1.1 por intensidade de raciocínio: base interna em 69,03%, depois 72,05%, 72,23% e 75,22% na configuração do Preview.
DeepSWE v1.1: a pontuação conforme cresce a intensidade de raciocínio.Baixar PNG 4K Baixar PNG 4K
Gráfico do FrontierSWE v2 por intensidade de raciocínio: base interna em 30,18%, depois 33,54%, 34,90%, 35,76% e 36,78% na configuração do Preview.Gráfico do FrontierSWE v2 por intensidade de raciocínio: base interna em 30,18%, depois 33,54%, 34,90%, 35,76% e 36,78% na configuração do Preview.
FrontierSWE v2: a pontuação conforme cresce a intensidade de raciocínio.Baixar PNG 4K Baixar PNG 4K

O eixo horizontal mostra a ordem das configurações. Ele não é uma escala comum de tokens, tempo ou custo.

Verificar também conta

A outra alavanca é a verificação. Com a intensidade de raciocínio fixa, aumentamos o quanto o modelo confere antes de decidir. No FrontierSWE, a pontuação sobe em todos os oito pontos medidos, de 36,20% a 36,78%. No DeepSWE, o penúltimo ponto chegou a 75,30%; reportamos 75,22%, o resultado da configuração mais alta.

Gráfico do DeepSWE v1.1 por intensidade de verificação: 74,09%, 74,20%, 74,39%, 74,49%, 74,73%, 74,84%, 75,30% e 75,22% no resultado reportado.Gráfico do DeepSWE v1.1 por intensidade de verificação: 74,09%, 74,20%, 74,39%, 74,49%, 74,73%, 74,84%, 75,30% e 75,22% no resultado reportado.
DeepSWE v1.1: a pontuação conforme cresce a intensidade de verificação.Baixar PNG 4K Baixar PNG 4K
Gráfico do FrontierSWE v2 por intensidade de verificação: 36,20%, 36,45%, 36,56%, 36,60%, 36,66%, 36,69%, 36,73% e 36,78% no resultado reportado.Gráfico do FrontierSWE v2 por intensidade de verificação: 36,20%, 36,45%, 36,56%, 36,60%, 36,66%, 36,69%, 36,73% e 36,78% no resultado reportado.
FrontierSWE v2: a pontuação conforme cresce a intensidade de verificação.Baixar PNG 4K Baixar PNG 4K

Como esses resultados se situam

Sozinho, o GLM 5.3 é o 7º colocado do DeepSWE entre 28 modelos, contando o melhor resultado público de cada um. Com o Deep Think, o mesmo modelo de base passa ao 1º lugar.

Ranking do DeepSWE v1.1 pelo melhor resultado público de cada modelo. Sem o Deep Think, o GLM 5.3 é o 7º, com 68,96%, atrás de GPT-6 Astra (74,12%), Gemini 3.8 Flash (73,83%), Claude Opus 5 (73,65%), GPT-5.6 Sol (72,67%), Claude Fable 5 (69,91%) e GPT-5.6 Terra (69,62%). Com o Deep Think, 75,22%, em 1º.Ranking do DeepSWE v1.1 pelo melhor resultado público de cada modelo. Sem o Deep Think, o GLM 5.3 é o 7º, com 68,96%, atrás de GPT-6 Astra (74,12%), Gemini 3.8 Flash (73,83%), Claude Opus 5 (73,65%), GPT-5.6 Sol (72,67%), Claude Fable 5 (69,91%) e GPT-5.6 Terra (69,62%). Com o Deep Think, 75,22%, em 1º.
O melhor resultado público de cada modelo no DeepSWE v1.1: o mesmo modelo de base vai do 7º ao 1º lugar.Baixar PNG 4K Baixar PNG 4K

Para os comparativos abaixo, reunimos resultados públicos de modelos selecionados. Cada um aparece com o maior esforço medido nas fontes, mesmo quando um esforço menor pontua mais.

No DeepSWE v1.1, o Preview fica à frente de toda a seleção, incluindo Gemini 3.8 Flash (73,83%) e GPT-6 Astra (73,23% em Max). No FrontierSWE v2, fica atrás de GPT-6 Astra (65,51%) e Fable 5.1 (56,29%) e à frente do GLM 5.3, o modelo de base, que tem 30,18% no placar público. No placar completo do FrontierSWE, Opus 5 e Fable 5 também ficam à frente do Preview.

Ranking dos dois benchmarks. DeepSWE v1.1: Rogue Deep Think (Preview) 75,22%, Gemini 3.8 Flash (high) 73,83%, GPT-6 Astra (Max) 73,23%, GLM 5.3 (Max) 68,96%, Kimi K3 (Max) 68,51%, Fable 5.1 (Max) 67,4%, Grok 4.6 (xhigh) 66,74%, DeepSeek V4 Pro (Max) 62,83% e Qwen 3.8 Max (xhigh) 57,46%. FrontierSWE v2: GPT-6 Astra (Max) 65,51%, Fable 5.1 (Max) 56,29%, Rogue Deep Think (Preview) 36,78%, GLM 5.3 (Max) 30,18%, Kimi K3 (Max) 25,87%, Grok 4.6 (Max) 25,29%, Gemini 3.8 Flash (Max) 19,63% e Qwen 3.8 Max (Max) 15,81%.Ranking dos dois benchmarks. DeepSWE v1.1: Rogue Deep Think (Preview) 75,22%, Gemini 3.8 Flash (high) 73,83%, GPT-6 Astra (Max) 73,23%, GLM 5.3 (Max) 68,96%, Kimi K3 (Max) 68,51%, Fable 5.1 (Max) 67,4%, Grok 4.6 (xhigh) 66,74%, DeepSeek V4 Pro (Max) 62,83% e Qwen 3.8 Max (xhigh) 57,46%. FrontierSWE v2: GPT-6 Astra (Max) 65,51%, Fable 5.1 (Max) 56,29%, Rogue Deep Think (Preview) 36,78%, GLM 5.3 (Max) 30,18%, Kimi K3 (Max) 25,87%, Grok 4.6 (Max) 25,29%, Gemini 3.8 Flash (Max) 19,63% e Qwen 3.8 Max (Max) 15,81%.
Os dois rankings, com o esforço de cada modelo entre parênteses.Baixar PNG 4K Baixar PNG 4K
Barras do DeepSWE v1.1, em ordem: Rogue Deep Think (Preview) 75,22%, Gemini 3.8 Flash (high) 73,83%, GPT-6 Astra (Max) 73,23%, GLM 5.3 (Max) 68,96%, Kimi K3 (Max) 68,51%, Fable 5.1 (Max) 67,4%, Grok 4.6 (xhigh) 66,74%, DeepSeek V4 Pro (Max) 62,83% e Qwen 3.8 Max (xhigh) 57,46%.Barras do DeepSWE v1.1, em ordem: Rogue Deep Think (Preview) 75,22%, Gemini 3.8 Flash (high) 73,83%, GPT-6 Astra (Max) 73,23%, GLM 5.3 (Max) 68,96%, Kimi K3 (Max) 68,51%, Fable 5.1 (Max) 67,4%, Grok 4.6 (xhigh) 66,74%, DeepSeek V4 Pro (Max) 62,83% e Qwen 3.8 Max (xhigh) 57,46%.
DeepSWE v1.1, com barras que começam do zero.Baixar PNG 4K Baixar PNG 4K
Barras do FrontierSWE v2, em ordem: GPT-6 Astra (Max) 65,51%, Fable 5.1 (Max) 56,29%, Rogue Deep Think (Preview) 36,78%, GLM 5.3 (Max) 30,18%, Kimi K3 (Max) 25,87%, Grok 4.6 (Max) 25,29%, Gemini 3.8 Flash (Max) 19,63% e Qwen 3.8 Max (Max) 15,81%.Barras do FrontierSWE v2, em ordem: GPT-6 Astra (Max) 65,51%, Fable 5.1 (Max) 56,29%, Rogue Deep Think (Preview) 36,78%, GLM 5.3 (Max) 30,18%, Kimi K3 (Max) 25,87%, Grok 4.6 (Max) 25,29%, Gemini 3.8 Flash (Max) 19,63% e Qwen 3.8 Max (Max) 15,81%.
FrontierSWE v2, com barras que começam do zero.Baixar PNG 4K Baixar PNG 4K
Ver os dados em tabela
Selected modelsPass@1
DeepSWE v1.1: selected models, sorted by score. Rogue results are internal.
Model and effortScore
Rogue Deep Think (Preview)75.22%
Gemini 3.8 Flash (high)73.83%
GPT-6 Astra (Max)73.23%
GLM 5.3 (Max)68.96%
Kimi K3 (Max)68.51%
Fable 5.1 (Max)*67.4%
Grok 4.6 (xhigh)66.74%
DeepSeek V4 Pro (Max)62.83%
Qwen 3.8 Max (xhigh)57.46%
Preview · medium effort. Full power soon.Contexto e fontes ↗

* Fable 5.1: resultado reportado pela Anthropic. Demais referências externas: Datacurve.

O que vem a seguir

Tudo o que está aqui foi medido em medium effort. A versão completa vem em breve, e vamos publicar os resultados dela quando estiverem medidos, com o mesmo cuidado de fontes deste texto.

O objetivo continua o mesmo: dar a quem constrói com a Rogue mais capacidade para investigar um problema difícil, chegar a uma solução que funciona e acompanhar o próprio trabalho.

Beyond Control. #GOROGUE

Contexto e fontes

Tabela dos dois benchmarks. DeepSWE v1.1: Rogue Deep Think (Preview) 75,22%, Gemini 3.8 Flash (high) 73,83%, GPT-6 Astra (Max) 73,23%, GLM 5.3 (Max) 68,96%, Kimi K3 (Max) 68,51%, Fable 5.1 (Max) 67,4%, Grok 4.6 (xhigh) 66,74%, DeepSeek V4 Pro (Max) 62,83% e Qwen 3.8 Max (xhigh) 57,46%. FrontierSWE v2: GPT-6 Astra (Max) 65,51%, Fable 5.1 (Max) 56,29%, Rogue Deep Think (Preview) 36,78%, GLM 5.3 (Max) 30,18%, Kimi K3 (Max) 25,87%, Grok 4.6 (Max) 25,29%, Gemini 3.8 Flash (Max) 19,63% e Qwen 3.8 Max (Max) 15,81%; DeepSeek V4 Pro sem resultado.Tabela dos dois benchmarks. DeepSWE v1.1: Rogue Deep Think (Preview) 75,22%, Gemini 3.8 Flash (high) 73,83%, GPT-6 Astra (Max) 73,23%, GLM 5.3 (Max) 68,96%, Kimi K3 (Max) 68,51%, Fable 5.1 (Max) 67,4%, Grok 4.6 (xhigh) 66,74%, DeepSeek V4 Pro (Max) 62,83% e Qwen 3.8 Max (xhigh) 57,46%. FrontierSWE v2: GPT-6 Astra (Max) 65,51%, Fable 5.1 (Max) 56,29%, Rogue Deep Think (Preview) 36,78%, GLM 5.3 (Max) 30,18%, Kimi K3 (Max) 25,87%, Grok 4.6 (Max) 25,29%, Gemini 3.8 Flash (Max) 19,63% e Qwen 3.8 Max (Max) 15,81%; DeepSeek V4 Pro sem resultado.
A seleção completa nos dois benchmarks, incluindo o modelo sem resultado publicado no FrontierSWE v2.Baixar PNG 4K Baixar PNG 4K

Rogue: avaliações internas do Preview, baseado em GLM 5.3, em medium effort. As bases internas são 69,03% no DeepSWE e 30,18% no FrontierSWE. O GLM 5.3 público no DeepSWE, com 68,96%, é outra execução.

Os resultados públicos e os internos vêm de condições diferentes de harness, orçamento e número de execuções. O melhor resultado público do DeepSWE, 74,12% do GPT-6 Astra em xhigh, tem intervalo de 95% entre 71,25% e 76,98% no próprio placar, e os 75,22% do Preview caem dentro dele: a diferença não estabelece superioridade estatística. O DeepSWE reporta pass@1 em quatro execuções de 113 tarefas. O FrontierSWE reporta mean@5 em 34 tarefas, com esforço máximo e até 20 horas por tentativa; a equivalência com o nosso ensaio interno ainda não foi estabelecida. No FrontierSWE, Max indica o esforço máximo declarado pelo operador, sem supor um parâmetro de API específico.

Fable 5.1: no DeepSWE, resultado informado pela Anthropic no system card; no FrontierSWE, a avaliação usa o Opus 5 nas tarefas bloqueadas por filtro de conteúdo. O GPT-6 Astra entrou no placar do FrontierSWE em 11 de setembro de 2026. O DeepSeek V4 Pro não tem resultado no FrontierSWE v2. A seleção não inclui todas as entradas dos placares; os placares completos estão nas fontes abaixo, consultadas em 18 de setembro de 2026.

Baixar todas as artesZIP, 16 MB · 14 artes em preto e branco, em PNG, SVG e PDF
AutoriaRogue