Não o número de parâmetros.
RAM ou VRAM dependendo do ambiente.
Com os mesmos critérios de revisão.
Comece com o trabalho, não com o modelo
Um excelente modelo para conclusão de código pode não ser a melhor escolha para resumir documentos longos. Primeiro defina a tarefa, a sensibilidade dos dados, a latência aceitável e se você precisa de texto, visão ou ferramentas.
Os dados podem sair do dispositivo?
Você precisa de respostas interativas ou processos em lote?
Que erros invalidam o resultado?
Apenas texto ou também imagem, áudio e arquivos?
Calcular memória com margem
O arquivo de modelo é apenas parte do consumo. O contexto, o cache e o próprio ambiente requerem espaço adicional. Evite planejar até o limite e reserve margem para o sistema.
| Cenário | Prioridade | O que medir |
|---|---|---|
| Conversar e escrever | Latência percebida | Hora do primeiro token e consistência |
| Documentos longos | Contexto útil | Recuperação de detalhes e compromissos |
| Programação | Correção | Testes aprovados e alterações desnecessárias |
| Processamento em lote | Desempenho | Tokens por segundo e custo de energia |
A quantização é uma compensação, não um atalho gratuito
A redução da precisão diminui o tamanho e pode acelerar a inferência, mas o impacto na qualidade não é uniforme. Dois modelos com o mesmo tamanho quantizado podem se comportar de maneira diferente na sua tarefa.
A janela máxima não é o contexto útil
O limite anunciado descreve quanto o sistema pode aceitar, não quanto recordará com a mesma precisão nem quanto cabe na tua memória. A cache de atenção cresce com a conversa e pode tornar-se o consumo dominante, mesmo que os pesos do modelo já estejam carregados.
Começa pelo contexto mínimo que resolve a tarefa. Para documentos extensos, compara o envio de todo o ficheiro com a recuperação apenas dos excertos relevantes. Mede se preserva instruções, citações e relações distantes; uma resposta fluida não demonstra que tenha utilizado corretamente toda a entrada.
Regista os pesos, a cache, o runtime e a margem do sistema separadamente.
Avalia os excertos, a sobreposição e a qualidade das referências devolvidas.
Coloca factos no início, no meio e no fim para detetar perdas de atenção.
Mede o tempo de prefill e de geração com comprimentos representativos.
A licença, a proveniência e a segurança também decidem
Antes de integrar um ficheiro de pesos, verifica a licença do modelo e da variante concreta. «Aberto» pode descrever o acesso aos pesos sem conceder os mesmos direitos para uso comercial, redistribuição, modificação ou treino derivado. Conserva o repositório, a versão e o texto da licença consultado.
Trata modelos, modelos de prompt e ficheiros transferidos como dependências externas. Verifica a origem, revê formatos que possam executar código, limita o acesso do processo e evita ligar ferramentas com privilégios amplos durante os primeiros testes. A execução local melhora o controlo dos dados, mas não elimina os riscos do conteúdo gerado nem da cadeia de fornecimento.
Faça um teste reproduzível
Salva a versão exata, configuração e conjunto de perguntas. O exemplo a seguir consulta informações do modelo antes de executá-lo com o Ollama.
ollama show nombre-del-modelo
ollama run nombre-del-modelo
- 01Congelar o conjunto
Use as mesmas 20 tarefas para todas as variantes.
- 02Cadastre o ambiente
Observe hardware, versão, contexto e parâmetros.
- 03Verificação cega
Oculte o nome do modelo ao avaliar as respostas.