Contattataci

Struttura del corso

Infrastruttura EXO come codice

  • Riepilogo dei modelli di distribuzione di EXO: cluster a nodo singolo, multi-nodo e RDMA
  • Automatizzazione dell’installazione delle dipendenze (Xcode, uv, Node.js, Rust) mediante gestione della configurazione
  • Utilizzo di Nix flakes per ottenere build riproducibili di EXO e ambienti di sviluppo coerenti
  • Scrittura di playbook Ansible o script shell per il provisioning automatico dei cluster

Build riproducibili e integrazione con CI

  • Fissare le dipendenze e generare il pannello di controllo nei pipeline CI
  • Esecuzione dei test preliminari su EXO tramite GitHub Actions o GitLab CI runners
  • Creazione di immagini di riferimento e procedure di rollback basate su snapshot per le VM macOS e Linux
  • Gestione della versione delle schede modello personalizzate insieme al codice dell’applicazione

Scoperta dei cluster e automazione di rete

  • Configurazione di mDNS e DNS statico per una corretta identificazione dei nodi libp2p
  • Automatizzazione della creazione dei profili di rete e della gestione del bridge Thunderbolt su macOS
  • Utilizzo di namespace personalizzati (EXO_LIBP2P_NAMESPACE) per differenziare gli ambienti di sviluppo, staging e produzione
  • Gestione delle regole firewall e della segmentazione di rete in ambienti multi-tenant

Archiviazione e gestione del ciclo di vita dei modelli

  • Definizione strategica delle impostazioni EXO_MODELS_DIRS ed EXO_MODELS_READ_ONLY_DIRS
  • Collegamento di condivisioni NFS o SAN come repository di modelli in sola lettura per una provisioning rapido
  • Eliminazione automatica delle cache obsolete e definizione delle policy di conservazione delle versioni dei pesi dei modelli
  • Automatizzazione del pre-download dei modelli e dei controlli di integrità prima degli aggiornamenti pianificati<\/li>

Monitoraggio e allerte

  • Inoltro dei log EXO a sistemi centralizzati come ELK, Loki o Splunk
  • Creazione di dashboard Grafana partendo dai dati di tracciamento generati da EXO_TRACING_ENABLED
  • Generazione di allerte per cambiamenti nella composizione dei cluster, eventi di esaurimento della memoria e picchi di latenza nelle inferenze
  • Rilevamento delle correlazioni tra dati hardware forniti da macmon e eventuali regressioni prestazionali dei modelli

Aggiornamenti, rollback e recupero da disastri

  • Distribuzione progressiva degli aggiornamenti binari di EXO su un nodo canary prima dell’espansione sull’intera rete
  • Rollback a livello modello: passaggio tra versioni quantizzate senza doverle riscaricare da capo
  • Eseguire il backup e il ripristino dello stato del cluster, dei namespace personalizzati e delle cache dei pesi modello
  • Redazione di runbook specifici per la ricostruzione totale dei cluster in caso di disastro

Refactoring della sicurezza e conformità normativa

  • Applicazione di TLS a livello del proxy inverso (nginx, traefik) per il pannello di controllo e le API EXO
  • Impostazione di limiti di richieste API e whitelisting degli IP autorizzati ad accedere agli endpoint EXO
  • Izolamento dei cluster mediante VLAN e policy di rete a zero trust
  • Auditing degli accessi e manutenzione aggiornata dell’elenco modelli attivi e delle loro versioni

Requisiti

  • Esperienza con le pratiche DevOps (CI/CD, infrastruttura come codice, orchestrazione di container)
  • Conoscenza della gestione dei sistemi macOS o Linux e del relativo gestionore di pacchetti
  • Comprensione dei concetti fondamentali relativi a reti, DNS e archiviazione

Destinatari

  • Ingegneri DevOps
  • Architetti delle infrastrutture
  • SRE responsabili della gestione dei carichi di lavoro AI on-premise
 21 ore

Numero di Partecipanti


Prezzo per partecipante

Recensioni (2)

Corsi in Arrivo

Categorie relative