Grazie per aver inviato la tua richiesta! Uno dei nostri team membri ti contatterà a breve.
Grazie per aver inviato il tuo prenotazione! Uno dei nostri team membri ti contatterà a breve.
Struttura del corso
Infrastruttura come codice per EXO
- Panoramica degli schemi di deployment di EXO: single-node, multi-node e cluster RDMA
- Automazione dell'installazione delle dipendenze (Xcode, uv, Node.js, Rust) con la gestione delle configurazioni
- Utilizzo di Nix flakes per build riproducibili di EXO e ambienti di sviluppo
- Scrittura di playbook Ansible o script shell per il provisioning non supervisionato dei cluster
Build Riproducibili e Integrazione CI
- Fissare le dipendenze e costruire la dashboard nelle pipeline CI
- Eseguire smoke test di EXO negli runner GitHub Actions o GitLab CI
- Creare golden image e flussi di lavoro di rollback basati su snapshot per VM macOS e Linux
- Versionare le card dei modelli personalizzate insieme al codice dell'applicazione
Scoperta del Cluster e Automazione di Rete
- Configurazione di mDNS e DNS statico per una discovery affidabile dei nodi libp2p
- Automazione della creazione dei profili di rete e gestione del bridge Thunderbolt su macOS
- Utilizzo di namespace personalizzati (EXO_LIBP2P_NAMESPACE) per separare cluster dev, staging e prod
- Regole firewall e segmentazione di rete per ambienti multi-tenant
Gestione dello Storage e del Ciclo di Vita dei Modelli
- Progettazione delle strategie EXO_MODELS_DIRS e EXO_MODELS_READ_ONLY_DIRS
- Mounting di condivisioni NFS o SAN come repository di modelli in sola lettura per un provisioning rapido
- Pulizia (garbage collection) delle cache obsolete e politiche di retention dei pesi versionati
- Automatizzare il precaricamento dei modelli e i check di salute prima degli aggiornamenti rolling
Monitoraggio e Allarmi
- Inoltro dei log EXO a un sistema di logging centralizzato (ELK, Loki o Splunk)
- Creazione di dashboard Grafana a partire dall'output EXO_TRACING_ENABLED
- Impostazione di allarmi per modifiche alla membership del cluster, eventi OOM e picchi di latenza dell'inference
- Correlazione delle telemetrie hardware macmon con regressioni delle prestazioni dei modelli
Aggiornamento, Rollback e Disaster Recovery
- Fase di staging degli aggiornamenti del binario EXO su un nodo canary prima del rollout sull'intera flotta
- Rollback a livello di modello: passaggio tra versioni quantizzate senza dover riscaricare i dati
- Backup e ripristino dello stato del cluster, namespace personalizzati e pesi in cache
- Documentazione dei runbook di recupero per scenari di ricostruzione completa del cluster
Rafforzamento della Sicurezza e Conformità
- Applicazione di TLS al livello del reverse proxy (nginx, traefik) per la dashboard e l'API
- Implementazione del rate limiting delle API e whitelisting degli IP per gli endpoint EXO
- Isolamento dei cluster con VLAN e politiche di rete zero-trust
- Audit dell'accesso e mantenimento di un inventario dei modelli distribuiti e delle versioni
Requisiti
- Esperienza con le pratiche DevOps (CI/CD, IaC, orchestrazione di container)
- Conoscenza dell'amministrazione di sistemi macOS o Linux e della gestione dei pacchetti
- Comprensione dei concetti di networking, DNS e storage
Pubblico
- Ingegneri DevOps
- Architetti dell'infrastruttura
- SRE responsabili per carichi di lavoro AI on-premise
21 ore
Recensioni (2)
Craig era estremamente coinvolto nella formazione, sempre assicurandosi che prestassimo attenzione, adattando gli esempi alle nostre attività quotidiane e fornendo sempre una risposta quando sollecitato, anche se l'informazione non era inclusa nella presentazione.
Ecaterina Ioana Nicoale - BOOKING HOLDINGS ROMANIA SRL
Corso - DevOps Foundation®
Traduzione automatica
Alto livello di impegno e conoscenza del formatore
Jacek - Softsystem
Corso - DevOps Engineering Foundation (DOEF)®
Traduzione automatica