PRIMEIRA DECISÃOO caso de uso

Não o número de parâmetros.

GARGALOMemória disponível

RAM ou VRAM dependendo do ambiente.

TESTE MÍNIMO20 tarefas reais

Com os mesmos critérios de revisão.

01

Comece com o trabalho, não com o modelo

Um excelente modelo para conclusão de código pode não ser a melhor escolha para resumir documentos longos. Primeiro defina a tarefa, a sensibilidade dos dados, a latência aceitável e se você precisa de texto, visão ou ferramentas.

Privacidade

Os dados podem sair do dispositivo?

Latência

Você precisa de respostas interativas ou processos em lote?

Qualidade

Que erros invalidam o resultado?

Modo

Apenas texto ou também imagem, áudio e arquivos?

02

Calcular memória com margem

O arquivo de modelo é apenas parte do consumo. O contexto, o cache e o próprio ambiente requerem espaço adicional. Evite planejar até o limite e reserve margem para o sistema.

CenárioPrioridadeO que medir
Conversar e escreverLatência percebidaHora do primeiro token e consistência
Documentos longosContexto útilRecuperação de detalhes e compromissos
ProgramaçãoCorreçãoTestes aprovados e alterações desnecessárias
Processamento em loteDesempenhoTokens por segundo e custo de energia
03

A quantização é uma compensação, não um atalho gratuito

A redução da precisão diminui o tamanho e pode acelerar a inferência, mas o impacto na qualidade não é uniforme. Dois modelos com o mesmo tamanho quantizado podem se comportar de maneira diferente na sua tarefa.

04

A janela máxima não é o contexto útil

O limite anunciado descreve quanto o sistema pode aceitar, não quanto recordará com a mesma precisão nem quanto cabe na tua memória. A cache de atenção cresce com a conversa e pode tornar-se o consumo dominante, mesmo que os pesos do modelo já estejam carregados.

Começa pelo contexto mínimo que resolve a tarefa. Para documentos extensos, compara o envio de todo o ficheiro com a recuperação apenas dos excertos relevantes. Mede se preserva instruções, citações e relações distantes; uma resposta fluida não demonstra que tenha utilizado corretamente toda a entrada.

Orçamento de memória

Regista os pesos, a cache, o runtime e a margem do sistema separadamente.

Recuperação

Avalia os excertos, a sobreposição e a qualidade das referências devolvidas.

Degradação

Coloca factos no início, no meio e no fim para detetar perdas de atenção.

Latência

Mede o tempo de prefill e de geração com comprimentos representativos.

05

A licença, a proveniência e a segurança também decidem

Antes de integrar um ficheiro de pesos, verifica a licença do modelo e da variante concreta. «Aberto» pode descrever o acesso aos pesos sem conceder os mesmos direitos para uso comercial, redistribuição, modificação ou treino derivado. Conserva o repositório, a versão e o texto da licença consultado.

Trata modelos, modelos de prompt e ficheiros transferidos como dependências externas. Verifica a origem, revê formatos que possam executar código, limita o acesso do processo e evita ligar ferramentas com privilégios amplos durante os primeiros testes. A execução local melhora o controlo dos dados, mas não elimina os riscos do conteúdo gerado nem da cadeia de fornecimento.

06

Faça um teste reproduzível

Salva a versão exata, configuração e conjunto de perguntas. O exemplo a seguir consulta informações do modelo antes de executá-lo com o Ollama.

TERMINAL
ollama show nombre-del-modelo
ollama run nombre-del-modelo
  1. 01
    Congelar o conjunto

    Use as mesmas 20 tarefas para todas as variantes.

  2. 02
    Cadastre o ambiente

    Observe hardware, versão, contexto e parâmetros.

  3. 03
    Verificação cega

    Oculte o nome do modelo ao avaliar as respostas.

07

Fontes e ferramentas