Contattataci

Struttura del corso

Infrastruttura come codice per EXO

  • Panoramica degli schemi di deployment di EXO: single-node, multi-node e cluster RDMA
  • Automazione dell'installazione delle dipendenze (Xcode, uv, Node.js, Rust) con la gestione delle configurazioni
  • Utilizzo di Nix flakes per build riproducibili di EXO e ambienti di sviluppo
  • Scrittura di playbook Ansible o script shell per il provisioning non supervisionato dei cluster

Build Riproducibili e Integrazione CI

  • Fissare le dipendenze e costruire la dashboard nelle pipeline CI
  • Eseguire smoke test di EXO negli runner GitHub Actions o GitLab CI
  • Creare golden image e flussi di lavoro di rollback basati su snapshot per VM macOS e Linux
  • Versionare le card dei modelli personalizzate insieme al codice dell'applicazione

Scoperta del Cluster e Automazione di Rete

  • Configurazione di mDNS e DNS statico per una discovery affidabile dei nodi libp2p
  • Automazione della creazione dei profili di rete e gestione del bridge Thunderbolt su macOS
  • Utilizzo di namespace personalizzati (EXO_LIBP2P_NAMESPACE) per separare cluster dev, staging e prod
  • Regole firewall e segmentazione di rete per ambienti multi-tenant

Gestione dello Storage e del Ciclo di Vita dei Modelli

  • Progettazione delle strategie EXO_MODELS_DIRS e EXO_MODELS_READ_ONLY_DIRS
  • Mounting di condivisioni NFS o SAN come repository di modelli in sola lettura per un provisioning rapido
  • Pulizia (garbage collection) delle cache obsolete e politiche di retention dei pesi versionati
  • Automatizzare il precaricamento dei modelli e i check di salute prima degli aggiornamenti rolling

Monitoraggio e Allarmi

  • Inoltro dei log EXO a un sistema di logging centralizzato (ELK, Loki o Splunk)
  • Creazione di dashboard Grafana a partire dall'output EXO_TRACING_ENABLED
  • Impostazione di allarmi per modifiche alla membership del cluster, eventi OOM e picchi di latenza dell'inference
  • Correlazione delle telemetrie hardware macmon con regressioni delle prestazioni dei modelli

Aggiornamento, Rollback e Disaster Recovery

  • Fase di staging degli aggiornamenti del binario EXO su un nodo canary prima del rollout sull'intera flotta
  • Rollback a livello di modello: passaggio tra versioni quantizzate senza dover riscaricare i dati
  • Backup e ripristino dello stato del cluster, namespace personalizzati e pesi in cache
  • Documentazione dei runbook di recupero per scenari di ricostruzione completa del cluster

Rafforzamento della Sicurezza e Conformità

  • Applicazione di TLS al livello del reverse proxy (nginx, traefik) per la dashboard e l'API
  • Implementazione del rate limiting delle API e whitelisting degli IP per gli endpoint EXO
  • Isolamento dei cluster con VLAN e politiche di rete zero-trust
  • Audit dell'accesso e mantenimento di un inventario dei modelli distribuiti e delle versioni

Requisiti

  • Esperienza con le pratiche DevOps (CI/CD, IaC, orchestrazione di container)
  • Conoscenza dell'amministrazione di sistemi macOS o Linux e della gestione dei pacchetti
  • Comprensione dei concetti di networking, DNS e storage

Pubblico

  • Ingegneri DevOps
  • Architetti dell'infrastruttura
  • SRE responsabili per carichi di lavoro AI on-premise
 21 ore

Numero di Partecipanti


Prezzo per partecipante

Recensioni (2)

Corsi in Arrivo

Categorie relative