Da Produção para o Código: Conheça o Athenas-Primal-8b, um LLM Focado em Engenharia de Software Agêntica

Se você acompanha a evolução dos Large Language Models (LLMs), já percebeu que modelos genéricos são ótimos para responder perguntas cotidianas ou gerar trechos simples de código, mas costumam falhar miseravelmente quando o assunto é resolver um bug complexo em um ambiente de produção real.

Falta de contexto multi-turn, incapacidade de simular o uso de ferramentas (como logs e terminais) e alucinações em cenários de concorrência são dores de cabeça comuns.

Para resolver exatamente esse gap, desenvolvi e acabo de lançar o Athenas-Primal-8b, um LoRA fine-tune projetado especificamente para engenharia de software agêntica e resolução de incidentes críticos.


O Coração do Modelo: O que há por baixo do capô?

O Athenas-Primal-8b foi treinado utilizando como fundação o Qwen3-8B (via Unsloth de 4-bits) e otimizado através do framework TRL (Transformer Reinforcement Learning) em uma instância AWS SageMaker equipada com uma GPU NVIDIA A10G.

O grande diferencial competititvo do modelo não está apenas na arquitetura, mas na qualidade do dataset utilizado para o fine-tuning: o fable-traces-mini.

Em vez de apenas ensinar a sintaxe de código, o modelo foi exposto a traces complexos de conversas multi-turn que simulam um engenheiro sênior atuando em produção. Isso inclui:

  • Pensamento Estruturado: Análise de causa raiz antes de sair escrevendo código.
  • Simulação de Ferramentas: Como o modelo deve interagir com ferramentas agênticas (verificação de arquivos, execução de testes, leitura de logs).
  • Multilinguismo Técnico: Cobertura de 8 linguagens principais (incluindo Python, Rust, Go, TypeScript/Node, Java, C++, C# e Ruby).

Se o problema envolve condições de corrida (race conditions), vazamento de memória (memory leaks) ou consultas N+1 que derrubam o banco de dados, o Athenas-Primal foi moldado para entender e corrigir.


Resultados e Performance (Os Números Não Mentem)

Fazer um fine-tuning focado em uma tarefa específica muitas vezes degrada a capacidade de raciocínio geral do modelo. No caso do Athenas-Primal-8b, aconteceu o oposto.

Nos testes de benchmark utilizando o framework lm-evaluation-harness, o modelo demonstrou um salto massivo em tarefas de raciocínio verbal e lógico espacial. O principal destaque foi no HellaSwag:

Métrica / Benchmark Qwen3-8B (Base) Athenas-Primal-8b Evolução
HellaSwag (acc_norm) 0.6580 0.7460 + 8.8%
MMLU (acc) 0.7020 0.7110 + 0.9%

Esse ganho de quase 9 pontos percentuais no HellaSwag valida a hipótese de que expor o modelo a históricos estruturados de resolução de problemas expande drasticamente sua capacidade de prever os próximos passos lógicos em um fluxo de engenharia.


Como Utilizar no seu Workflow

O modelo está disponível publicamente no Hugging Face e, graças à otimização do Unsloth, você pode rodá-lo localmente com um consumo de memória extremamente baixo via FastLanguageModel.

Aqui está o snippet básico para começar a testar a inferência:

from unsloth import FastLanguageModel
import torch

# 1. Carregar o modelo e o tokenizer
model, tokenizer = FastLanguageModel.from_pretrained(
    model_name = "Kodjaoglanian/athenas-primal-8b",
    max_seq_length = 4096,
    load_in_4bit = True,
)
FastLanguageModel.for_inference(model)

# 2. Definir o prompt com o contexto do bug
inputs = tokenizer(
[
    "<|im_start|>system\nYou are a senior software engineering agent specialized in production debugging.<|im_end|>\n<|im_start|>user\nReview this trace log and fix the memory leak in our Go scheduler...<|im_end|>\n<|im_start|>assistant\n"
], return_tensors = "pt").to("cuda")

# 3. Gerar a solução
outputs = model.generate(**inputs, max_new_tokens = 512, use_cache = True)
print(tokenizer.decode(outputs[0]))

Aviso Importante: O Athenas-Primal-8b foi treinado como um especialista de nicho. Ele não foi feito para conversas genéricas (como pedir receitas de bolo ou tradução de textos literários). O foco aqui é estritamente engenharia e automação agêntica.


Próximos Passos

O repositório já está público e pronto para testes. O objetivo agora é avançar na integração desse adapter de 8B parâmetros em CLIs locais e ferramentas de automação de pipeline (CI/CD) para que ele possa abrir e corrigir Pull Requests de forma autônoma.

Se quiser testar, dar um feedback ou contribuir com novos traces, acesse a página do projeto no Hugging Face:
👉 Kodjaoglanian/athenas-primal-8b


O que achou dessa estrutura? Quer mudar o tom para algo mais ou menos técnico, ou focar em algum detalhe específico do dataset?

Subscribe to Kodjao Labs

Don’t miss out on the latest issues. Sign up now to get access to the library of members-only issues.
[email protected]
Inscreva-se