close
Vés al contingut

Google Cloud Dataflow

De la Viquipèdia, l'enciclopèdia lliure

Google Cloud Dataflow és un servei completament gestionat per executar pipelines Apache Beam dins de l'ecosistema de Google Cloud Platform. Dataflow proporciona un servei completament gestionat per executar pipelines Apache Beam, oferint funcions com ara escalat automàtic, reequilibri dinàmic del treball i un entorn d'execució gestionat.[1]

Dataflow és adequat per a tasques de processament de dades continu i a gran escala, i és un dels components principals de l'arquitectura de big data de Google a la plataforma Google Cloud.[2]

En essència, l'arquitectura de Dataflow està dissenyada per abstraure la gestió de la infraestructura, permetent als desenvolupadors centrar-se únicament en la lògica de les seves tasques de processament de dades. Quan s'envia un pipeline escrit amb l'SDK d'Apache Beam, Dataflow tradueix aquesta definició d'alt nivell en un gràfic de treballs optimitzat. El servei aprovisiona i gestiona una flota de treballadors de Google Compute Engine per executar aquest gràfic d'una manera altament paral·lelitzada i tolerant a errors. Aquest enfocament sense servidor, combinat amb l'escalat automàtic intel·ligent tant del nombre de treballadors (horitzontals) com dels recursos per treballador (verticals), garanteix que els treballs tinguin la quantitat precisa de potència computacional necessària en un moment donat, optimitzant tant el rendiment com el cost.[3]

La profunda integració del servei amb l'ecosistema de Google Cloud el converteix en una eina potent per a una varietat de casos d'ús més enllà del simple moviment de dades. Per a l'anàlisi en temps real, Dataflow pot ingerir fluxos de dades il·limitats de Cloud Pub/Sub, realitzar transformacions complexes i carregar resultats a BigQuery per a consultes immediates. En els fluxos de treball d'aprenentatge automàtic, s'utilitza habitualment per preprocessar i transformar conjunts de dades massius emmagatzemats a Cloud Storage, preparant-los per a models d'entrenament a Vertex AI. Aquesta versatilitat el converteix en el motor de processament central per a operacions ETL (Extracció, Transformació, Càrrega) modernes, anàlisi de transmissió i preparació de dades a gran escala dins del núvol.[4]

Història

[modifica]

Google Cloud Dataflow es va anunciar al juny de 2014 i es va llançar al públic general com a beta oberta a l'abril de 2015. El gener de 2016, Google va donar l'SDK subjacent, la implementació d'un executor local i un conjunt d'IO (connectors de dades) per accedir als serveis de dades de Google Cloud Platform a l'Apache Software Foundation. El codi donat va formar la base original d'Apache Beam.

A l'agost de 2022, hi va haver un incident en què els temporitzadors d'usuari es van trencar per a certes canalitzacions de transmissió de Dataflow en diverses regions, que es va resoldre posteriorment.[5] Al llarg del 2023 i el 2024, hi ha hagut diverses altres actualitzacions i incidents que han afectat Google Cloud Dataflow, tal com es documenta a les notes de la versió i a l'historial d'estat del servei.[6]

La donació del SDK de Dataflow a l'Apache Software Foundation va ser un moment crucial, establint Apache Beam com un model de programació unificat i de codi obert per definir pipelines de dades per lots i en temps real. Aquest moviment estratègic va desacoblar la definició del pipeline del motor d'execució. Com a resultat, els desenvolupadors van poder escriure lògica de processament de dades portàtil que no estava bloquejada a l'ecosistema de Google. Un pipeline Beam es pot executar en diversos executors, com ara Apache Flink, Apache Spark i, per descomptat, el servei altament optimitzat Google Cloud Dataflow, proporcionant flexibilitat i preparant les inversions en processament de dades per al futur.

Característiques

[modifica]

Google Cloud Dataflow admet tant pipelines de processament de dades per lots com en streaming. Gestiona automàticament el subministrament de recursos, la fragmentació de dades i l'escalat segons la càrrega de treball, reduint la configuració manual necessària per a operacions de dades a gran escala.[7]

Casos d'ús

[modifica]

Dataflow s'utilitza per a pipelines de dades ETL (Extracció, Transformació, Càrrega), anàlisi en temps real i processament de fluxos d'esdeveniments per a empreses de sectors com ara finances, publicitat i IoT.[8]

Referències

[modifica]
  1. «Cloud Dataflow Runner» (en anglès). beam.apache.org. [Consulta: 3 juliol 2024].
  2. «GCP Dataflow and Apache Beam for ETL Data Pipeline» (en anglès). EPAM Anywhere. [Consulta: 3 juliol 2024].
  3. «Dataflow overview» (en anglès). [Consulta: 28 juny 2026].
  4. Robert, Jérémy. «GCP Dataflow: What is it? What’s it for?» (en anglès britànic), 28-01-2026. [Consulta: 28 juny 2026].
  5. «Google Cloud Service Health» (en anglès). status.cloud.google.com. [Consulta: 3 juliol 2024].
  6. «Dataflow enhancements in 2023» (en anglès americà). Google Cloud Blog. [Consulta: 3 juliol 2024].
  7. “Overview | Google Cloud Dataflow,” Google Cloud Documentation. Retrieved 2025-08-xx.
  8. Example Blog Post / Case Study from X company