Learn AI, Data Science & Business — Earn Certificates That Get You Hired
Learn EDR Internals: Research & Development From The Masters
Overview
Google, IBM & Meta Certificates – 40% Off
One Coursera Plus subscription covers most Professional Certificates on Coursera.
Unlock All Certificates
This session explains how Ray is engineered to run reliably on clusters exceeding 10,000 nodes despite network flakiness, spot preemptions, hardware failures, and resource contention. It covers fault tolerance, state management, recovery, elasticity, and workload-aware scheduling for large-scale AI workloads.
Syllabus
Building Fault-Tolerant Massive Ray Clusters on Anyscale | Ray Summit 2025
Taught by
Anyscale