Für wen das ist
Gründer und kleine Teams, deren Produkt oder Shop auf Servern läuft, die niemand wirklich verantwortet: Das Hosting hat ein früherer Entwickler eingerichtet, Backups existieren, wurden aber nie wiederhergestellt, an Kampagnentagen läuft die Festplatte voll, und jedes Deployment passiert von Hand mit gedrückten Daumen.
Ich betreibe die Linux-Server unter meinen eigenen Produkten und unter den Shops, die ich betreue: Web-Panels auf CentOS und Ubuntu, Nginx, PHP-FPM, MySQL und PostgreSQL, Redis, Docker mit CapRover, VMware-VMs und AWS, wo es passt. Das ist kein Managed-Hosting-Produkt; es ist die Betriebsarbeit, die ein Senior Engineer macht, damit die Anwendungsarbeit sicher bleibt.
Typische Situationen
- Dem Server gingen während einer Kampagne Festplatte, Speicher oder PHP-Worker aus, und niemand hat es kommen sehen.
- Backups laufen jede Nacht auf dieselbe Festplatte, und niemand hat je eine Wiederherstellung versucht.
- Fehler-Logs wachsen wegen eines Plugins um Gigabytes pro Tag, und der Festplattenalarm ist das erste Anzeichen.
- Eine Website wurde kompromittiert, und die Bereinigung war ein Plugin-Scan; der Einstiegspunkt ist noch offen.
- Deployments sind FTP-Uploads auf die Produktion; es gibt kein Staging und keinen Weg zurück.
- Mehrere Websites teilen sich einen Server, und eine davon reißt die anderen mit.
Was ich liefere
- Server-Einrichtung und Härtung auf Linux: Nginx oder Apache, PHP-FPM-Pools, MySQL oder PostgreSQL, Redis, Firewall, SSH-Zugang, Updates, mit der Konfiguration in der Versionskontrolle.
- Backups mit Wiederherstellungsübungen: was gesichert wird, wohin, wie oft, wie lange eine Wiederherstellung dauert, nach Plan getestet und aufgeschrieben.
- Monitoring und Alarme, die einen Menschen erreichen: Festplatte, Speicher, PHP-Worker, Queue-Tiefe, Zertifikatsablauf, Fehlerrate, Verfügbarkeit.
- Deployment-Pfade mit Staging und Rollback: CI/CD-Pipelines, Docker mit CapRover für Produkte, Releases ohne Ausfallzeit für Shops, ein getesteter Weg zurück.
- Virtualisierung und Umzüge: VMware-VMs, Umzüge zwischen Hostern oder in die Cloud, Kapazitätsplanung aus echter Last.
- Incident Response und Bereinigung: die Ursache finden, entfernen, was ein Angreifer hinterlassen hat, Log-Hygiene und ein schriftliches Post-mortem, damit es sich nicht wiederholt.
Wie es abläuft
Bestandsaufnahme und Risiko. Was läuft wo, wer hat Zugang, was wird gesichert, welche Alarme gibt es, und was passiert, wenn die Festplatte heute Nacht stirbt. Das erste Ergebnis ist eine schriftliche Risikoliste, nach Schaden und Wahrscheinlichkeit geordnet.
Die Risiken der Reihe nach beheben. Backups und eine getestete Wiederherstellung kommen zuerst, dann Monitoring, dann der Deployment-Pfad. Jede Änderung passiert in einem Wartungsfenster mit einem Weg zurück.
Übergeben oder weiter betreiben. Alles endet in einem Dokument, das die nächste Person nutzen kann: Zugänge, Konfiguration, Runbooks für die üblichen Ausfälle. Im Retainer betreibe ich weiter und schicke eine kurze monatliche Notiz.