Fala, devs! 🚀
Lancei o hawkdot, monitoramento de infra open source (HTTP, SSL e ping).
Codei no vibe em 1 final de semana. Ainda é a v1, mas já funciona.
👉 https://t.co/f8wh8SF6vM
Manda feedback ou estrela o repo!
#devBR#infra#opensource
Finalmente! Saiu o resultado do novo LLM Coding Benchmark V4!!
Foram 10 dias rodando 24/7, milhões de tokens e dezenas de horas de compute pra conseguir o melhor benchmark de programação prática que eu consegui até agora.
Re-testei 39 das principais LLMs do mercado, de Astra e Fable, até Deepseek ou GLM, até Qwen 3.8 Max e 27bi Local!
Ficou tão longo, que dividi em 2 partes. Pra entender o histórico, os objetivos, a metodologia, siga pra parte 1:
https://t.co/YnRCjPho5x
Pra ir direto pros resultados, tabela de ranking, análises, prós e contras de cada categoria de modelos, siga pra Parte 2:
https://t.co/d8TJaHQTDJ
A diferença deste V4 em relação aos anteriores é que em vez de mandar fazer um app, agora eu simulo mini-sprints (7 no total), e simulando um programador malicioso externo adicionando código malicioso e bugs sutis pra ver quem consegue chegar até o fim com um app que funcionaria em produção (nada de leetcodes ou similares). E por isso cada execução pode levar mais de 1h (ou 12 horas no caso do Qwen 3.8 27bi local).
Espero que gostem!
Caramba, estava fazendo um teste de scraping de dados usando o Astra 6 e o Opus 5. Com o mesmo prompt, achei incrível como os dados foram divergentes entre si hahaha.
Claude Codeさんが落ちたのでお仕事切り上げます
API Error: 500 {"type":"error","error":{"type":"api_error","message":"Internal server error"},"request_id":"req_011Ca21yDjoSca2UjMUMofR5"}