One-Shot Prompting

O One-Shot Prompting (ou Prompting com Um Exemplo) é o ponto intermediário perfeito entre o Zero-Shot (apenas instruções) e o Few-Shot (múltiplos exemplos). Ele consiste em fornecer exatamente um único exemplo de entrada e saída esperada antes de apresentar o problema ou a pergunta final que você deseja que a LLM resolva. A Escala de … Ler mais

Open-weight

O termo open-weight (ou pesos abertos em uma tradução livre) descreve um modelo de distribuição e licenciamento de inteligência artificial em que os pesos treinados do modelo são disponibilizados publicamente. Embora esse modelo seja frequentemente chamado pela mídia de “código aberto” (open-source), a comunidade técnica prefere o termo open-weight por ser mais preciso e honesto … Ler mais

Quantização

A Quantização (ou Quantization) é uma das técnicas fundamentais de otimização no campo do Aprendizado de Máquina. Ela permite compactar Grandes Modelos de Linguagem (LLMs), reduzindo drasticamente o consumo de memória (VRAM/RAM) e acelerando o tempo de resposta, com uma perda mínima na capacidade de raciocínio. Em termos simples, quantizar é reduzir a precisão numérica … Ler mais

Self-Attention

O Mecanismo de Atenção (especificamente o Self-Attention ou Autoatenção) é a inovação matemática que tornou as LLMs viáveis. Antes dele, as redes neurais processavam texto de forma sequencial, esquecendo o início da frase ao chegar no final. O mecanismo de atenção resolveu isso permitindo que o modelo foque dinamicamente nas partes mais relevantes de todo … Ler mais

Token

Tokens são as unidades básicas de informação que uma LLM processa. Eles não são necessariamente palavras inteiras; podem ser sílabas, caracteres ou partes de palavras. A tokenização é o processo de transformar o texto bruto em uma sequência desses tokens para que a rede neural consiga realizar os cálculos matemáticos. O que é um Token? … Ler mais

VRAM

A VRAM (sigla para Video Random Access Memory, ou Memória de Acesso Aleatório de Vídeo) é um tipo especial de memória RAM de altíssima velocidade dedicada exclusivamente ao processamento gráfico e a operações de computação paralela intensa, como o treinamento e a inferência de redes neurais e Grandes Modelos de Linguagem (LLMs). A VRAM fica … Ler mais