01
Kubernetes und Developer Platforms
Wenn Cluster über Jahre gewachsen sind, eine Platform neu aufgebaut werden soll oder eine Migration festhängt.
Dann entwerfe ich die Zielarchitektur, baue oder migriere Cluster und richte GitOps, Delivery, Namespaces, Zugriffsrechte, Autoscaling und Observability ein.
Danach können Teams selbst deployen, ohne dass jedes Release zum Ops-Ticket wird.
02
Cloud Cost
Wenn die Cloud-Rechnung schneller wächst als die Nutzung und unklar ist, welche Workloads die Kosten treiben.
Dann zerlege ich die Kosten nach Workload, dimensioniere Ressourcen neu, entferne Ungenutztes und prüfe Commitments, Rabatte, Storage und Traffic. Die Änderungen setze ich anschließend direkt um.
Danach sinken die laufenden Kosten bei gleicher oder besserer Performance. Bei einem früheren Kunden waren das rund 10.000 € pro Monat.
03
Data Platforms und Datenbanken
Wenn Queries langsamer werden, eine Migration ansteht oder eine Datenbank unter Last instabil wird.
Dann arbeite ich an PostgreSQL, MongoDB, Elasticsearch und ClickHouse: Sharding, Replikation, Performance-Analyse, Backup und Restore sowie Migrationen mit kontrolliertem Cutover.
Danach bleibt die Datenschicht auch unter echter Last stabil und berechenbar.
04
Private AI Infrastructure
Wenn Inference in die eigene Infrastruktur soll, weil Daten das Unternehmen nicht verlassen dürfen oder die Kosten der API-Nutzung zu stark steigen.
Dann baue ich die Infrastruktur dafür: GPU Nodes, Scheduling, Model Serving, Skalierung und Betriebsabläufe für Language, Speech, Vision, Embeddings und LLM Inference.
Danach laufen die Modelle in Ihrer Umgebung. Datenpfade und Betriebskosten bleiben transparent. Eigener Betrieb ist nicht kostenlos, aber kontrollierbar.
05
Troubleshooting und Infrastructure Security
Wenn derselbe Fehler immer wiederkommt oder Security-Hardening dauerhaft im Backlog liegen bleibt.
Dann suche ich die Ursache und setze die Korrekturen um. Dazu härte ich Cluster, sichere Netzwerkpfade ab, bereinige Zugriffsrechte und Secrets und schaffe verlässliche Wege für Patches und Updates.
Danach ist das Problem an der Ursache behoben, und die Absicherung passt zu Ihrer Umgebung. Bei Rackspace standen Diagnose und Umstellungsplan nach zwei Wochen. Die Umsetzung erfolgte während des zweimonatigen Einsatzes.
06
Laufender Betrieb und Weiterentwicklung
Wenn die Platform nach dem Projekt weiter betrieben und weiterentwickelt werden soll.
Dann arbeiten wir mit klaren Zuständigkeiten, abgestimmter Erreichbarkeit und einem Modell, das zu Ihrem Team passt.
Danach bleibt die Platform gepflegt und entwickelt sich weiter, auch wenn intern gerade Kapazität fehlt.