[paper] The Dataflow Model: A Practical Approach to BalancingCorrectness, Latency, and Cost in Massive-Scale,Unbounded, Out-of-Order Data Processing
이번주 논문은 apache beam의 기초가 된는 Dataflow Model에 대한 설명 논문 입니다. https://www.vldb.org/pvldb/vol8/p1792-Akidau.pdf 1. 기존 문제점- "언젠가 데이터가 모두 모인다"의 전제로 데이터파이프라인 구성- 서비스 로그, 모바일 로그, 센서 데이터의 경우 순서가 뒤섞이며, 늦게 도착해 수정/취소 될수 있음 - MapReduce, Hadoop, Pig, Hive, Spark 등은 모든 입력을 모은 뒤 처리해야 하므로 지연시간 문제 발생- 스트리밍 시스템은 낮은 지연시간을 제공할 수 있지만, 정확성, 장애 내성, exactly-once semantics, event-time 기반 windowing 등 한계 발생 - lamdba 아키텍처는..