Blogg

Frågor om big data som vi ofta får — raka svar

Frågor som ständigt dyker upp kring Spark-, dbt- och Flink-pipelines — samma frågor som format vad opti-pipes regelmotor faktiskt kontrollerar.

Läs på:
Filtrera efter tagg:
Filtrera efter nivå:

SparkJunior

Varför blev mitt Spark-jobb plötsligt långsammare utan kodändringar?

Nio gånger av tio är det inte koden. Det är datan, klustret eller en konfiguration som tyst slutade matcha någon av dem.

CostMellannivå

Hur sänker jag min Databricks-/EMR-/Glue-räkning utan att förstöra något?

Inte varje kostnadshävstång bär samma risk. Här är ordningen som ger dig riktiga besparingar innan du rör något som faktiskt skulle kunna förstöra en pipeline.

InfraSenior

Vad är rätt klusterstorlek och autoskalningspolicy för den här arbetsbelastningen?

Rätt klusterstorlek är inte ett tal du väljer en gång — det är en policy du sätter utifrån hur din arbetsbelastning faktiskt beter sig, och sedan ser över när det beteendet ändras.

dbtMellannivå

Hur snabbar jag upp dbt-modeller och sänker Snowflake-/BigQuery-beräkningskostnaden?

I ett dbt-projekt är körtid och lagerräkning nästan samma mätvärde med två namn — att fixa det ena fixar oftast det andra.

CostMellannivå

Hur minskar jag kostnaden för mitt Flink-kluster utan att förstöra checkpointing?

Notan skenar inte iväg på grund av ett enda dåligt jobb — den kryper uppåt på grund av några inställningar som ställdes in en gång vid utrullningen och aldrig setts över igen. Här är var man bör börja.