Blog

Fragen zu Big Data, die uns ständig gestellt werden — direkt beantwortet

Fragen, die bei Spark-, dbt- und Flink-Pipelines ständig aufkommen — dieselben, die geprägt haben, was die Regel-Engine von opti-pipe tatsächlich prüft.

Lesen auf:
Nach Tag filtern:
Nach Level filtern:

SparkJunior

Warum ist mein Spark-Job plötzlich langsamer geworden, ohne Code-Änderungen?

Neun von zehn Mal liegt es nicht am Code. Es liegt an den Daten, am Cluster oder an einer Konfiguration, die still aufgehört hat, zu beidem zu passen.

CostMittleres Level

Wie senke ich meine Databricks-/EMR-/Glue-Rechnung, ohne etwas kaputtzumachen?

Nicht jeder Kostenhebel trägt das gleiche Risiko. Hier die Reihenfolge, die echte Einsparungen bringt, bevor Sie etwas anfassen, das eine Pipeline wirklich kaputtmachen könnte.

InfraSenior

Wie groß sollte mein Cluster sein, und welche Autoscaling-Policy passt zu diesem Workload?

Die richtige Cluster-Größe ist keine Zahl, die man einmal festlegt — es ist eine Policy, die Sie aus dem tatsächlichen Verhalten Ihres Workloads ableiten und überprüfen, wenn sich dieses Verhalten ändert.

dbtMittleres Level

Wie beschleunige ich dbt-Modelle und senke die Snowflake-/BigQuery-Rechenkosten?

In einem dbt-Projekt sind Laufzeit und Warehouse-Rechnung fast dieselbe Kennzahl mit zwei Namen — das eine zu beheben behebt meist auch das andere.

CostMittleres Level

Wie senke ich die Kosten meines Flink-Clusters, ohne das Checkpointing zu brechen?

Die Rechnung schnellt nicht wegen eines einzelnen schlechten Jobs in die Höhe — sie kriecht durch ein paar Einstellungen nach oben, die einmal beim Rollout festgelegt und nie wieder überprüft wurden. Hier lohnt sich der erste Blick.