Canva-Ausfall

20. Januar 2025 | Miscelanea

Hinter dem Canva-Ausfall im November 2024: Was schief gelaufen ist und wie es weitergeht

Vor Kurzem kam es bei Canva zu einem erheblichen Ausfall, der den Zugriff auf die Plattform fast eine Stunde lang unterbrach und Benutzern weltweit den Zugriff auf das Designtool erschwerte. Dieser Ausfall unterbrach die Arbeitsabläufe von Kreativprofis, Vermarktern und Kleinunternehmern, die für Aufgaben wie die Erstellung von Grafiken, Präsentationen und Werbematerialien für soziale Medien auf Canva angewiesen sind, und verdeutlichte damit die entscheidende Rolle der Plattform im täglichen Betrieb. Von 9:08 Uhr UTC bis 10:00 Uhr UTC war canva.com vollständig nicht verfügbar, was für die Plattform ein seltenes Ereignis ist. In diesem Blog werden die Ursachen des Ausfalls, sein Verlauf, die unmittelbar ergriffenen Schritte zur Wiederherstellung der Funktionalität und die Präventivmaßnahmen untersucht, die Canva ergreift, um ähnliche Vorfälle in Zukunft zu vermeiden.

Die Anatomie des Ausfalls

Der Ausfall war auf ein Zusammentreffen mehrerer Faktoren zurückzuführen, darunter:

  • Ein Problem bei der Softwarebereitstellung: Mit der Einführung wurden Verbesserungen am Canva-Editor eingeführt, darunter eine verbesserte Leistung des Objektbereichs und zusätzliche Funktionen zur Ebenenverwaltung. Ein unvorhergesehener Fehler in der Bereitstellungspipeline verursachte jedoch Kompatibilitätsprobleme mit dem clientseitigen Caching, was zu dem Vorfall beitrug.
  • Netzwerkinstabilität: Cloudflare, der CDN-Anbieter von Canva, hatte auf seiner Netzwerkroute von Singapur nach Ashburn Probleme mit Latenz und Paketverlusten.
  • Ein Sperrproblem im API-Gateway: Ein Telemetriefehler in der Infrastruktur von Canva verschärfte die Leistungsprobleme weiter.

Diese miteinander verbundenen Probleme überforderten letztendlich das API-Gateway von Canva, eine kritische Komponente, die für die Authentifizierung, Autorisierung und Ratenbegrenzung von API-Anfragen zuständig ist, und verursachten einen kaskadierenden Fehler, der die Site unzugänglich machte.

Wie sich der Vorfall entwickelte

Erstbereitstellung (8:47 Uhr UTC)
Eine neue Version des Canva-Editors wurde live geschaltet und forderte Client-Geräte auf, aktualisierte statische Assets aus dem Caching-System von Cloudflare abzurufen. Zu diesen Assets gehörte eine JavaScript-Datei, die für die Anzeige des Objektbereichs des Editors unerlässlich ist.

Netzwerklatenz tritt auf
Gleichzeitig kam es auf Cloudflares Netzwerkroute von Singapur nach Ashburn zu einem dramatischen Anstieg der Latenz, wobei die Zeit bis zum ersten Byte um über 1700 % anstieg. Das Abrufen einer kritischen JavaScript-Datei dauerte bis zu 20 Minuten, sodass Benutzer in Asien das Objektfenster nicht laden konnten.

Cache-Stream-Überlastung
Das Caching-System von Cloudflare aggregierte über 270,000 Anfragen für dieselbe JavaScript-Datei. Als das Asset um 9:07 Uhr UTC endlich geladen war, überwältigte eine „donnernde Herde“ von 1.5 Millionen gleichzeitigen API-Anfragen das API-Gateway von Canva und verdreifachte damit die typische Spitzenlast.

API-Gateway-Zusammenbruch
Aufgrund des stark gestiegenen Datenverkehrs verschlechterte sich die Leistung des API-Gateways aufgrund eines Telemetriefehlers, der Thread-Locking-Probleme verursachte. Dies führte zu einer Überbeanspruchung des Arbeitsspeichers, was den Linux Out-Of-Memory Killer auslöste und alle auf dem Gateway laufenden Aufgaben beendete. Um 9:08 Uhr UTC war canva.com vollständig offline.

Die Krise eindämmen

Das Entwicklungsteam von Canva reagierte mit einer Reihe von Maßnahmen:

  1. Skalieren von API Gateway-Aufgaben: Erste Versuche, Aufgaben automatisch zu skalieren, schlugen fehl, da neue Aufgaben durch anhaltende Verkehrsspitzen überlastet wurden.
  2. Blockieren des Datenverkehrs auf CDN-Ebene: Um 9:29 Uhr UTC hat Canva vorübergehend den gesamten Datenverkehr auf der CDN-Ebene blockiert, um das API-Gateway zu stabilisieren.
  3. Allmähliche Wiederherstellung des Verkehrs: Beginnend mit australischen Benutzern unter strengen Ratenbeschränkungen stellte Canva schrittweise den globalen Zugriff wieder her und stellte dabei bei jedem Schritt die Systemstabilität sicher.

Um 10:00 Uhr UTC war die Plattform wieder online.

Erkenntnisse und Aktionsplan

Um die Zuverlässigkeit zu verbessern und zukünftigen Ausfällen vorzubeugen, hat Canva sofortige und langfristige Maßnahmen zur Behebung kritischer Bereiche skizziert:

Im Bereich der Reaktion auf Störungen entwickelt Canva ein umfassendes Handbuch für das Traffic-Management in Notfällen und arbeitet an einer verbesserten Nutzerkommunikation durch verständlichere Fehlermeldungen während Ausfallzeiten. Um die Ausfallsicherheit des API-Gateways zu erhöhen , plant das Team, die Basiskapazität und den Speicherplatz zu erweitern, Lastverteilungsregeln zur besseren Bewältigung von Trafficspitzen zu implementieren und regelmäßige Lasttests zur Simulation extremer Szenarien durchzuführen.

Um spezifische Probleme wie den Telemetrie-Bug zu beheben , hat Canva einen Patch zur Behebung des Thread-Sperrproblems veröffentlicht und optimiert seine Testprozesse, um ähnliche Komplikationen künftig zu vermeiden. Für die Bereitstellung werden zusätzliche Sicherheitsvorkehrungen eingeführt, darunter die Überwachung von Seitenladeereignissen, die Verlängerung der Canary-Release-Phasen zur besseren Erkennung von Problemen während gestaffelter Rollouts und die Einführung von Timeouts für Asset-Anfragen, um längere Verzögerungen zu vermeiden.

Schließlich arbeitet Canva eng mit Cloudflare zusammen , um die Traffic-Weiterleitung und die Caching-Mechanismen zu optimieren und so eine reibungslosere Bewältigung von Spitzenlastsituationen zu gewährleisten. Gemeinsam zielen diese Maßnahmen darauf ab, die Infrastruktur von Canva zu stärken und ähnliche Ausfälle künftig zu verhindern.

Ein Bekenntnis zur Transparenz

Dieser Ausfall ist der erste öffentlich zugängliche Vorfallbericht von Canva und spiegelt das Engagement des Unternehmens für Transparenz und kontinuierliche Verbesserung wider. Mit der wachsenden Benutzerbasis von Canva wächst auch das Engagement des Unternehmens, eine widerstandsfähige Infrastruktur aufzubauen, die seine Mission unterstützt, die Welt zum Gestalten zu befähigen.

Die Bemühungen von Canva, den Ausfall zu analysieren und zu beheben, unterstreichen den proaktiven Ansatz des Unternehmens, aus Herausforderungen zu lernen. Mit der Umsetzung dieser Änderungen möchte Canva seinen Millionen von Benutzern weltweit eine robustere und zuverlässigere Plattform bieten.

Lösungen zur Vermeidung von Ausfällen nutzen

Ausfälle wie der von Canva können oft mit robusten Lösungen, die die Belastbarkeit der Infrastruktur verbessern, gemildert oder sogar ganz verhindert werden. Tools wie RELIANOIDDie Hochleistungsproxys und API-Gateway-Optimierungen von bieten wichtige Vorteile, darunter Lastausgleich in Echtzeit, erweiterte Verkehrsführung und automatisierte Failover-Mechanismen. Durch den Einsatz modernster Telemetriesysteme und Hot-Restart-Funktionen gewährleisten solche Tools einen reibungslosen Betrieb auch unter extremen Bedingungen. Unternehmen, die diese Lösungen einsetzen, können Leistungsengpässe proaktiv beheben, die Reaktion auf Vorfälle verbessern und eine konstante Betriebszeit für kritische Anwendungen aufrechterhalten. Kontakt aufnehmen .

Verwandte Blogs

Veröffentlicht von reluser | 02. September 2026
Der Bedarf an Schutz sensibler Daten war noch nie so hoch. Globale Regulierungen in den Bereichen Finanzen, Gesundheitswesen, Cloud und kritische Infrastrukturen verpflichten Unternehmen nun dazu, ihre Abwehrmaßnahmen gegen reale Angriffe zu testen. Penetrationstests…
396 LikesKommentare deaktiviert zu Compliance-Standards, die Penetrationstests erfordern – und wie RELIANOID Übertrifft die Erwartungen
Veröffentlicht von reluser | 18. August 2026
Die Grenzen reaktiver Sicherheitsmaßnahmen: Security Operations Center (SOCs) wurden für die Erkennung und Reaktion konzipiert. Warnmeldungen werden generiert. Analysten untersuchen die Situation. Maßnahmen werden ergriffen. Doch moderne Bedrohungslandschaften entwickeln sich rasant weiter…
1.81K-Gefällt mirKommentare deaktiviert Von SOC zu autonomer Infrastruktur: Wie KI die Anwendungssicherheit neu definiert
Veröffentlicht von reluser | 07. August 2026
Mit zunehmender Komplexität digitaler Infrastrukturen wird die Aufrechterhaltung reibungsloser und reaktionsschneller Dienste immer schwieriger. Unternehmen benötigen Lösungen, die sich in Echtzeit an schwankende Verkehrsaufkommen, Serververfügbarkeit und Benutzerverhalten anpassen können.
2.77K-Gefällt mirKommentare deaktiviert zur Leistungssteigerung mit adaptiven Lastverteilern