Grazie per aver inviato la tua richiesta! Uno dei nostri team membri ti contatterà a breve.
Grazie per aver inviato il tuo prenotazione! Uno dei nostri team membri ti contatterà a breve.
Struttura del corso
Sovranità AI e distribuzione locale dei modelli linguistici
- Rischi legati all’uso di servizi cloud per i modelli linguistici: conservazione dei dati, addestramento su input utente e giurisdizione estera.
- Architettura di Ollama: server dei modelli, registro centralizzato e API compatibile con OpenAI.
- Rispetto ad altri strumenti come vLLM, llama.cpp e Text Generation Inference.
- Condizioni di licenza per i modelli Llama, Mistral, Qwen e Gemma.
Installazione ed ottimizzazione hardware
- Installazione di Ollama su Linux con supporto per CUDA e ROCm.
- Gestione degli ambienti a sola CPU, compresa l’ottimizzazione tramite AVX/AVX2.
- Distribuzione tramite Docker con mappatura dei volumi persistenti.
- Configurazione di sistemi multi-GPU e gestione dinamica della VRAM.
Gestione dei modelli
- Importazione rapida dei modelli dal registro Ollama: esempio ollama pull llama3.
- Utilizzo di modelli GGUF provenienti da HuggingFace e TheBloke.
- Confronto tra i livelli di quantizzazione Q4_K_M, Q5_K_M e Q8_0.
- Gestione simultanea di più modelli ed eventuali limitazioni nel loro caricamento.
Creazione di Modelfile personalizzati
- Sintassi per la creazione di Modelfile: comandi FROM, PARAMETER, SYSTEM e TEMPLATE.
- Ottimizzazione dei parametri come temperatura, top_p e repeat_penalty.
- Progettazione di prompt sistematici adatti a ruoli specifici degli utenti.
- Creazione ed esportazione di modelli personalizzati verso il proprio registro locale.
Integrazione tramite API
- Utilizzo dell’endpoint /v1/chat/completions conforme agli standard OpenAI.
- Gestione della trasmissione in tempo reale dei risultati e attivazione della modalità JSON.
- Integrazione con strumenti come LangChain, LlamaIndex e applicazioni proprie.
- Misure di sicurezza: autenticazione utente e limiti alle richieste tramite proxy inverso.
Ottimizzazione delle prestazioni
- Gestione ottimale della dimensione del contesto e del cache KV.
- Elaborazione batch e gestione parallela delle richieste.
- Allocazione efficiente dei thread di CPU con considerazione dei vincoli NUMA.
- Monitoraggio continuo dell’utilizzo della GPU e dello stato della memoria.
Sicurezza e conformità normativa
- Isolementazione di rete dei punti di erogazione dei modelli linguistici.
- Filtraggio degli input e moderazione delle risposte generate.
- Registrazione dettagliata di ogni richiesta ed output generato.
- Verifica dell’autenticità dei modelli tramite hash crittografici.
Requisiti
- Conoscenze di base nell’amministrazione di Linux e dei container.
- Culture generale sui modelli di apprendimento automatico e sui trasformatori.
- Familiarità con le API REST e il formato JSON.
Destinatari del corso
- Ingegneri AI e sviluppatori che desiderano sostituire le API cloud dei modelli linguistici.
- Organizzazioni con requisiti di riservatezza dati tali da rendere inadatta l’utilizzazione di servizi cloud.
- Enti governativi e militari che necessitano di modelli linguistici isolati e sicuri.
14 ore