Last updated
    llama.cpp
    Libro

    llama.cpp

    Georgi Gerganov, Diego Devesa

    2023

    Panoramica

    Il 10 marzo 2023, Georgi Gerganov ha pubblicato il primo commit di llama.cpp su GitHub. La libreria, scritta in C e C++, mirava a fare una cosa: eseguire i modelli LLaMA di Meta su una CPU di un laptop senza GPU. Nel giro di poche settimane, ha ottenuto migliaia di stelle e una comunità crescente di sviluppatori che ne spingevano le capacità oltre.

    L'innovazione principale è la quantizzazione. Comprimendo i pesi del modello da floating-point a 32 bit a interi a 4 o 8 bit utilizzando il formato GGUF, llama.cpp riduce i requisiti di memoria del 75% o più. Un modello con 7 miliardi di parametri, che necessiterebbe di 28 GB di VRAM su una GPU, può funzionare con meno di 6 GB di RAM di sistema. Il formato GGUF raggruppa anche il tokenizer, il vocabolario e il template della chat in un unico file, semplificando la distribuzione del modello.

    llama.cpp supporta una gamma insolitamente ampia di hardware: CPU x86 con AVX2, Apple Silicon tramite Metal, GPU NVIDIA con CUDA, GPU AMD con hipBLAS, GPU Intel con SYCL e persino Vulkan. Il progetto fornisce strumenti da riga di comando per generazione, benchmark e conversione di modelli, insieme a un server HTTP leggero. A partire dal 2025, conta oltre 900 contributori e 69.000 stelle su GitHub. Strumenti come Ollama e LM Studio si basano direttamente su llama.cpp, rendendo l'inferenza LLM locale accessibile agli utenti non tecnici. La libreria è diventata lo standard de facto per eseguire modelli linguistici di grandi dimensioni su hardware consumer, consentendo sperimentazioni AI private ed economiche senza dipendenze dal cloud.

    Parole chiave

    llama.cppGGUFquantizzazioneLLM localeinferenzaopen-sourceGeorgi Gerganovinferenza su CPUapprendimento automatico

    Info Libro

    Autore
    Georgi Gerganov, Diego Devesa
    Pubblicato
    2023-03-10
    Autore
    Georgi Gerganov, Diego Devesa
    Initial Release
    March 10, 2023
    License
    MIT License
    Repository
    github.com/ggml-org/llama.cpp
    Written in
    C, C++

    Link

    Unisciti alla community

    fan che discutono