Modelos, avaliação
e método.
O trabalho técnico por trás do Shakk — o que já foi validado, o que estamos testando e como avaliamos se um modelo está pronto.
Metodologia
Como decidimos se um modelo está pronto.
Avaliação orientada por hipótese
Cada mudança de treino parte de uma hipótese testável, não de "vamos ver se melhora". Regressão em qualquer eixo é motivo de investigação, não só o eixo que se quis melhorar.
Conversa real, não só bateria isolada
Um modelo pode vencer uma bateria de perguntas soltas e ainda assim colapsar numa conversa longa de verdade — por isso conversas fixas de múltiplos turnos fazem parte de toda avaliação.
Preferir admitir a inventar
Um modelo que admite não saber é preferível a um que responde com confiança sem base. Isso é medido a cada avaliação, não só desejado.
Onde estamos
Trabalho em andamento, não benchmark pronto.
A Fluqxo ainda não publicou artigos técnicos ou benchmarks formais — o Shakk está em desenvolvimento ativo, e a infraestrutura de inferência que vai sustentar as respostas em produção ainda está sendo colocada no ar. Preferimos não publicar números até que representem o sistema real que você vai usar.
Quando houver avaliação pronta pra compartilhar, ela aparece aqui — com metodologia, dados e limitações, não só o resultado favorável.