
llama.cpp
Georgi Gerganov, Diego Devesa
Panoramica
Il 10 marzo 2023, Georgi Gerganov ha pubblicato il primo commit di llama.cpp su GitHub. La libreria, scritta in C e C++, mirava a fare una cosa: eseguire i modelli LLaMA di Meta su una CPU di un laptop senza GPU. Nel giro di poche settimane, ha ottenuto migliaia di stelle e una comunità crescente di sviluppatori che ne spingevano le capacità oltre.
L'innovazione principale è la quantizzazione. Comprimendo i pesi del modello da floating-point a 32 bit a interi a 4 o 8 bit utilizzando il formato GGUF, llama.cpp riduce i requisiti di memoria del 75% o più. Un modello con 7 miliardi di parametri, che necessiterebbe di 28 GB di VRAM su una GPU, può funzionare con meno di 6 GB di RAM di sistema. Il formato GGUF raggruppa anche il tokenizer, il vocabolario e il template della chat in un unico file, semplificando la distribuzione del modello.
llama.cpp supporta una gamma insolitamente ampia di hardware: CPU x86 con AVX2, Apple Silicon tramite Metal, GPU NVIDIA con CUDA, GPU AMD con hipBLAS, GPU Intel con SYCL e persino Vulkan. Il progetto fornisce strumenti da riga di comando per generazione, benchmark e conversione di modelli, insieme a un server HTTP leggero. A partire dal 2025, conta oltre 900 contributori e 69.000 stelle su GitHub. Strumenti come Ollama e LM Studio si basano direttamente su llama.cpp, rendendo l'inferenza LLM locale accessibile agli utenti non tecnici. La libreria è diventata lo standard de facto per eseguire modelli linguistici di grandi dimensioni su hardware consumer, consentendo sperimentazioni AI private ed economiche senza dipendenze dal cloud.
Parole chiave
Info Libro
- Autore
- Georgi Gerganov, Diego Devesa
- Pubblicato
- 2023-03-10
- Autore
- Georgi Gerganov, Diego Devesa
- Initial Release
- March 10, 2023
- License
- MIT License
- Repository
- github.com/ggml-org/llama.cpp
- Written in
- C, C++
Unisciti alla community
fan che discutono