duelo direto

Sonnet 5 vs Fable 5

Placar 7×2 em 9 testes reais de vibe coding — julgamento cego, custo medido, código auditável.

Placar por teste 7 × 2 Sonnet 5 × Fable 5
Custo da bateria $3,22 vs $7,43 soma dos runs medidos
Vencedor geral Sonnet 5 score do ranking cego
Teste Sonnet 5 Fable 5 Vencedor
001 3D interativo Defeitos $0,25 · 1m 18s · score 0,73 Defeitos $0,78 · 1m 47s · score 0,69 Sonnet 5
002 clone de site Entregou $0,22 · 1m 37s · score 0,98 Entregou $0,94 · 2m 31s · score 0,92 Sonnet 5
003 física/canvas Entregou $0,18 · 1m 6s · score 0,97 Entregou $0,59 · 1m 28s · score 0,92 Sonnet 5
004 jogo 3D Defeitos $0,28 · 1m 56s · score 0,73 Entregou $2,11 · 6m 1s · score 0,87 Fable 5
101 debug Entregou $0,18 · 29s · score 0,80 Entregou $0,31 · 33s · score 0,68 Sonnet 5
103 feature em código existente Entregou $0,18 · 46s · score 0,86 Entregou $0,49 · 1m 16s · score 0,65 Sonnet 5
104 CSS responsivo Defeitos $1,28 · 10m 43s · score 0,25 Entregou $0,70 · 2m 15s · score 0,82 Fable 5
105 code review Entregou $0,25 · 2m 1s · score 0,82 Entregou $0,69 · 2m 13s · score 0,64 Sonnet 5
108 dados Entregou $0,40 · 2m 56s · score 0,81 Entregou $0,83 · 2m 12s · score 0,69 Sonnet 5

veredito e custo de results.json · score por teste de scores.json (qualidade 50% · preço 25% · velocidade 25%)

Onde Sonnet 5 leva

  • Domina em velocidade e custo: clone de site (97s vs 151s, $0.22 vs $0.94), física (66s vs 88s, $0.18 vs $0.59)
  • Vence em 7 testes com scores superiores em tarefas rápidas (debug 0.80 vs 0.68, features 0.80 vs 0.55), ideal para trilha dia-a-dia
  • Custo 57% menor ($3.22 vs $7.43) mesmo com performance ligeiramente mais alta

Onde Fable 5 leva

  • Entrega jogo 3D com sucesso (0.87) onde Sonnet apenas apresenta defeitos (0.73)
  • Resolve CSS responsivo (0.82) enquanto Sonnet falha severamente (0.25 após 643s)

Qual escolher

Sonnet 5 para a maioria dos projetos: mais rápido, mais barato e com melhor qualidade média. Fable 5 apenas se a carga inclui 3D complexo ou CSS responsivo crítico — mas o trade-off (2.3x mais caro) só compensa se esses testes representam >30% do throughput.

Outros duelos