GGUF

A sigla GGUF significa GPT-Generated Unified Format (Formato Unificado Gerado por GPT). Trata-se de um formato de arquivo binário criado pela comunidade de código aberto (liderada por Georgi Gerganov e pelos mantenedores do projeto llama.cpp) para armazenar e carregar modelos de linguagem (LLMs) de forma otimizada para execução em hardware de consumo (CPUs de computadores … Ler mais

Open-weight

O termo open-weight (ou pesos abertos em uma tradução livre) descreve um modelo de distribuição e licenciamento de inteligência artificial em que os pesos treinados do modelo são disponibilizados publicamente. Embora esse modelo seja frequentemente chamado pela mídia de “código aberto” (open-source), a comunidade técnica prefere o termo open-weight por ser mais preciso e honesto … Ler mais

Quantização

A Quantização (ou Quantization) é uma das técnicas fundamentais de otimização no campo do Aprendizado de Máquina. Ela permite compactar Grandes Modelos de Linguagem (LLMs), reduzindo drasticamente o consumo de memória (VRAM/RAM) e acelerando o tempo de resposta, com uma perda mínima na capacidade de raciocínio. Em termos simples, quantizar é reduzir a precisão numérica … Ler mais

VRAM

A VRAM (sigla para Video Random Access Memory, ou Memória de Acesso Aleatório de Vídeo) é um tipo especial de memória RAM de altíssima velocidade dedicada exclusivamente ao processamento gráfico e a operações de computação paralela intensa, como o treinamento e a inferência de redes neurais e Grandes Modelos de Linguagem (LLMs). A VRAM fica … Ler mais