Pular para o conteúdo

Apresentando o Rogue Deep Think

O modelo mais poderoso da Rogue para engenharia de software. Ainda em medium effort, o Preview fez 75,22% no DeepSWE v1.1 e 36,78% no FrontierSWE v2.

DeepSWE v1.175,22%Acima de todos os resultados do placar públicoAvaliação interna · medium effort

Resumo

  • DeepSWE v1.1: 75,22% em medium effort, 6,19 pp acima da base interna do GLM 5.3 (+9,0% relativo). Nenhuma das 70 configurações do placar público chega a esse valor; a maior é 74,12%.
  • FrontierSWE v2: 36,78%, 6,60 pp acima da base interna (+21,9% relativo). No placar completo, ficaria em 5º entre 15, à frente do GPT-5.6 e de todos os modelos open-weight.
  • Escala com computação. A pontuação sobe conforme o Preview usa mais computação no momento da resposta, nos dois benchmarks, e o resultado reportado ainda é medium effort.
  • Avaliação interna, não submetida aos operadores dos benchmarks. O método não é descrito nesta versão.

Escala com computação

O Deep Think transforma computação no momento da resposta em acerto. Medimos o Preview com orçamentos crescentes em dois eixos, raciocínio e verificação, e a pontuação sobe nos dois, no DeepSWE e no FrontierSWE.

Duas curvas de ganho conforme o Preview usa mais computação. Raciocínio: +6,19 pontos no DeepSWE v1.1 e +6,60 no FrontierSWE v2 na configuração mais alta. Verificação: +1,13 e +0,58.Duas curvas de ganho conforme o Preview usa mais computação. Raciocínio: +6,19 pontos no DeepSWE v1.1 e +6,60 no FrontierSWE v2 na configuração mais alta. Verificação: +1,13 e +0,58.
Ganho em pontos percentuais conforme o Preview usa mais computação.Baixar PNG 4K Baixar PNG 4K

Os eixos mostram a ordem das configurações, não o orçamento. O método, o orçamento de cada configuração e o custo por tarefa ficam fora desta versão.

Avaliações

Contra a base interna do GLM 5.3, o Preview sobe 6,19 pontos no DeepSWE e 6,60 no FrontierSWE. Em termos relativos, são 9,0% e 21,9%: o ganho relativo é maior justamente no benchmark mais difícil.

Barras do Rogue Deep Think (Preview) contra a base interna do GLM 5.3: no DeepSWE v1.1, de 69,03% para 75,22%, 9,0% a mais; no FrontierSWE v2, de 30,18% para 36,78%, 21,9% a mais.Barras do Rogue Deep Think (Preview) contra a base interna do GLM 5.3: no DeepSWE v1.1, de 69,03% para 75,22%, 9,0% a mais; no FrontierSWE v2, de 30,18% para 36,78%, 21,9% a mais.
O Preview contra o próprio modelo de base, com barras que começam do zero.Baixar PNG 4K Baixar PNG 4K

No DeepSWE, contando o melhor resultado público de cada um dos 28 modelos do placar, o GLM 5.3 está em 7º. Com o Deep Think, o mesmo modelo de base passa ao 1º.

Ranking do DeepSWE v1.1 pelo melhor resultado público de cada modelo. Sem o Deep Think, o GLM 5.3 é o 7º, com 68,96%, atrás de GPT-6 Astra (74,12%), Gemini 3.8 Flash (73,83%), Claude Opus 5 (73,65%), GPT-5.6 Sol (72,67%), Claude Fable 5 (69,91%) e GPT-5.6 Terra (69,62%). Com o Deep Think, 75,22%, em 1º.Ranking do DeepSWE v1.1 pelo melhor resultado público de cada modelo. Sem o Deep Think, o GLM 5.3 é o 7º, com 68,96%, atrás de GPT-6 Astra (74,12%), Gemini 3.8 Flash (73,83%), Claude Opus 5 (73,65%), GPT-5.6 Sol (72,67%), Claude Fable 5 (69,91%) e GPT-5.6 Terra (69,62%). Com o Deep Think, 75,22%, em 1º.
O melhor resultado público de cada modelo no DeepSWE v1.1: o mesmo modelo de base vai do 7º ao 1º lugar.Baixar PNG 4K Baixar PNG 4K

O Preview foi medido em medium effort. Nos oito modelos do gráfico abaixo, as 20 configurações públicas vão do low ao max, e nenhuma chega a 75,22%.

Os 20 níveis de esforço públicos de oito modelos no DeepSWE v1.1, de low a max. O maior é o GPT-6 Astra em xhigh, com 74,12%; nenhum chega aos 75,22% do Rogue Deep Think (Preview).Os 20 níveis de esforço públicos de oito modelos no DeepSWE v1.1, de low a max. O maior é o GPT-6 Astra em xhigh, com 74,12%; nenhum chega aos 75,22% do Rogue Deep Think (Preview).
Cada ponto é uma configuração pública, do low ao max. Nenhuma chega aos 75,22% do Preview, medido em medium effort.Baixar PNG 4K Baixar PNG 4K

O que muda na prática

No DeepSWE, cada tarefa é uma mudança real em um projeto de código aberto, e a solução de referência adiciona em média 668 linhas em 7 arquivos. Com a base, 30,97% das tentativas falhavam; com o Preview, 24,78%. São 20% menos falhas: uma em cada cinco tentativas que falhavam passa a dar certo.

Tentativas que falham no DeepSWE v1.1, a cada 100: 30,97 com a base interna do GLM 5.3 e 24,78 com o Rogue Deep Think (Preview), 20% a menos.Tentativas que falham no DeepSWE v1.1, a cada 100: 30,97 com a base interna do GLM 5.3 e 24,78 com o Rogue Deep Think (Preview), 20% a menos.
Tentativas que falham no DeepSWE v1.1, a cada 100: uma em cada cinco falhas passa a dar certo.Baixar PNG 4K Baixar PNG 4K

No FrontierSWE, em que uma tentativa pode durar até 20 horas, os 36,78% colocariam o Preview à frente do GPT-5.6 (32,20%) e de todos os modelos open-weight do placar, liderados pelo GLM 5.3 com 30,18%.

Placares públicos

Os resultados usados nas comparações, com a incerteza que cada operador publica.

DeepSWE v1.1

DeepSWE v1.1: pass@1 e intervalo de confiança de 95% publicados pela Datacurve
Modelo (esforço)pass@1 (%)IC 95%Fonte
Rogue Deep Think (Preview)75,22não publicadoRogue, interna
GPT-6 Astra (xhigh)ref.74,1271,25 a 76,98Datacurve
Gemini 3.8 Flash (high)73,8372,41 a 75,24Datacurve
Claude Opus 5 (max)ref.73,6569,78 a 77,52Datacurve
GPT-6 Astra (Max)73,2372,40 a 74,06Datacurve
GLM 5.3 (Max)68,9665,94 a 71,98Datacurve
Kimi K3 (Max)68,5163,98 a 73,05Datacurve
Fable 5.1 (Max)67,4não publicadoAnthropic, 5 execuções
Grok 4.6 (xhigh)66,7464,56 a 68,92Datacurve
DeepSeek V4 Pro (Max)62,8356,50 a 69,17Datacurve
Qwen 3.8 Max (xhigh)57,4654,80 a 60,12Datacurve

FrontierSWE v2

FrontierSWE v2: mean@5 e faixa entre a pior e a melhor de cinco tentativas
Modelo (esforço)mean@5 (%)worst@5 a best@5Fonte
GPT-6 Astra (Max)65,5155,11 a 73,00Proximal
Fable 5.1 (Max)56,2944,47 a 66,65Proximal, fallback Opus 5
Claude Opus 5 (Max)ref.52,0139,12 a 60,65Proximal
Claude Fable 5 (Max)ref.46,9633,90 a 61,77Proximal
Rogue Deep Think (Preview)36,78não publicadoRogue, interna
GLM 5.3 (Max)30,1817,72 a 40,64Proximal
Kimi K3 (Max)25,8713,87 a 37,55Proximal
Grok 4.6 (Max)25,2912,86 a 37,29Proximal
Gemini 3.8 Flash (Max)19,639,51 a 31,64Proximal
Qwen 3.8 Max (Max)15,818,70 a 24,27Proximal

Um resultado por modelo, com o maior esforço publicado, mesmo quando um esforço menor pontua mais (Grok 4.6: medium 67,48% contra xhigh 66,74%). As linhas marcadas com ref. estão no placar e fora da seleção das artes da versão geral. O placar do DeepSWE foi gerado em 3 de setembro de 2026. O GPT-6 Astra entrou no FrontierSWE em 11 de setembro; o texto de metodologia do benchmark foi escrito antes e ainda cita o Fable 5.1 como líder.

Contexto dos benchmarks

  • SWE-bench Verified. A OpenAI parou de reportar em 23/02/2026: todos os modelos de ponta que testou reproduziam parte das soluções de referência, 59,4% de 138 problemas auditados tinham defeito no teste ou na descrição, e o topo andou de 74,9% para 80,9% em seis meses.
  • SWE-bench Pro. Na auditoria de 08/07/2026, a OpenAI marcou 27,4% das tarefas pelo pipeline de agentes e 34,1% pela anotação humana; na divisão pública, de 731 tarefas, a aprovação foi de 23,3% para 80,3% em oito meses. A recomendação de usá-lo foi retirada.
  • DeepSWE v1.1. 113 tarefas escritas do zero, em 91 repositórios e 5 linguagens, nunca enviadas aos projetos originais, com verificadores comportamentais escritos à mão. pass@1 em 4 execuções por tarefa, com o mini-swe-agent. A solução de referência adiciona em média 668 linhas em 7 arquivos (SWE-bench Pro: 120 em 5; Verified: 10 em 1).
  • FrontierSWE v2. 34 tarefas de horizonte ultralongo em cinco áreas: pesquisa em IA, implementação, otimização de desempenho, computação científica e raciocínio visual. Até 20 h por tentativa, esforço máximo, harness Proximus, mean@5.

Limitações

  • Avaliação interna, não submetida aos operadores. Harness, orçamento e número de execuções diferem dos placares.
  • Sem intervalo de confiança publicado para as execuções internas. No DeepSWE, os 75,22% ficam dentro do intervalo de 95% do maior resultado público (74,12%, de 71,25% a 76,98%): a diferença para ele não é estatisticamente estabelecida.
  • FrontierSWE: a equivalência entre o ensaio interno e o mean@5 público não foi estabelecida.
  • Medium effort é o rótulo interno da avaliação. O esforço usado na base interna não está documentado nesta versão.
  • O método, o orçamento de computação e o custo por tarefa não são publicados nesta versão. Os eixos do gráfico de escala são ordinais.
  • Fable 5.1 no DeepSWE: resultado do fornecedor (5 execuções, system card p. 168), fora do placar da Datacurve. No FrontierSWE, usa o Opus 5 nas tarefas bloqueadas por filtro de conteúdo.

Fontes

Placares consultados em 18 de setembro de 2026.

Baixar todas as artesZIP, 16 MB · 14 artes em preto e branco, em PNG, SVG e PDF
AutoriaRogue