전체 글 (1268) 썸네일형 리스트형 [paper] Spanner: Google’s Globally-Distributed Database -1. 단어 설명상태 머신 복제(State Machine Replication)같은 초기 상태에서 시작해 같은 명령들을 같은 순서로 실행하면 항상 같은 결과 상태에 도달하는 결정적(deterministic) 시스템데이터베이스가 대표적으로 빈 DB에 "x=1 쓰기 → y=2 쓰기 → x 삭제"를 순서대로 적용하면 언제나 결과는 일치한다.Paxos: 합의(consensus) 알고리즘- 안전성: 일부 서버가 죽거나 메시지가 유실 / 지연되어도, 서로 다른 서버가 서로 다른 값에 합의하는 일은 절대 없다.- 과반수(quorum) 원리: 전체 복제본의 과반수만 살아 있으면 진행할 수 있다. 5대 중 2대가 죽어도 나머지 3대로 쓰기가 계속 되며 반드시 겹치는 서버가 하나는 있기 때문에 이전 합의 내용이 유실되지 .. 오퍼월 데이터 spark vs bigquery 리포트 작업 비교 0. 결론오퍼월 3단 퍼널 로그(노출, 클릭, 전환)로 일별 캠페인 집계 리포트를 만드는 작업에서 Spark와 BigQuery를 비교했다.결론은 이 워크로드는 BigQuery scheduled query로 유지하는 것으로 결론을 냈다. 13GB 규모에서는 Spark와 BigQuery의 1회 실행 비용이 모두 같은 자릿수를 유지 했다.Spark 변환 자체는 37.5초였지만, 실행 환경 기동에 약 90초 소요spakr 사용시 정기 집계 하나를 위해 클러스터, 의존성, 스케줄러를 추가로 운영할 필요이번 PoC는 Spark / BigQuery 같은 산출물을 두 엔진에서 구현하고 데이터 운영 비용까지 포함해 현재 조건에 맞는 엔진을 고른 작업이었다. 1. 비교 범위현재 일별 캠페인 집계는 BigQuery.. [paper] C-Store: A Column-oriented DBMS C-Store: A Column-oriented DBMShttps://web.stanford.edu/class/cs345d-01/rl/cstore.pdf0. 핵심 요약기존 DBMS는 INSERT/UPDATE를 중심으로 설계되어 있었지만, 데이터 웨어하우스는 대부분의 작업이 읽기(SELECT) 이다. 분석 데이터 베이스는 기존의 DBMS에 비해 쓰기보다 읽기가 압도적으로 많으므로 설계 방식과 다르게 다음을 방향으로 설계 되었다.- Column 단위 저장- Projection 기반 저장- 적극적인 Compression- Read Optimized Storage- Snapshot Isolation- Bitmap Index 활용1. 기존 문제점1.1 대부분의 상용 DBMS가 OLTP 중심으로 설계- Row 단위.. Task 5. Identify a specific day Task 5. Identify a specific dayBuild a query that will answer: "On what day did the total number of deaths cross 8000 in Italy?" The query should return the date in the format yyyy-mm-dd.Columns to reference:country_namecumulative_deceased WITH italy_deaths_by_date AS ( SELECT date, SUM(cumulative_deceased) AS deaths FROM `bigquery-public-data.covid19_open_data.covid19_open_data` WHE.. Kafka connect (5) - schema registry schema registry란?kafka 메시지의 스키마(필드 이름과 타입 정의)를 중앙에서 버전 관리하는 REST 서비스로 저장소로 별도 DB를 쓰지 않고 kafka 자신의 내부 토픽(_schemas)을 사용한다. kafka 브로커는 메시지를 그냥 바이트 덩어리로 취급하기 때문에 "이 토픽의 메시지가 어떤 형태여야 하는가"를 아무도 강제하지 않는다. producer와 consumer가 형태에 대한 약속을 각자 코드에 들고 있을 뿐이고 필드를 바꾸는 순간 소비 시점에야 깨진다. schema registry는 템플릿으로 정해둔 코드를 관리를 담당해준다. subject - 스키마가 등록되는 단위. 기본 전략은 {토픽이름}-value(키는 -key)라서 토픽마다 스키마가 하나씩 등록된다.스키마 ID와 버전.. Kafka connect (4) - kafka connect to gcs 파일 저장 sink 커넥터로 토픽 메시지를 parquet 파일로 만들어 GCS 버킷에 적재한다.parquet + 날짜 파티션 경로로 잘라두면 이후 spark나 BigQuery external table이 바로 읽을 수 있도록 저장한다. 1. 준비$ gcloud storage buckets create gs://uiandwe-kafka-lab --location=us 권한이 있는 서비스키로 준비 SA 키 파일을 broker 컨테이너 안으로 복사$ gcloud storage buckets add-iam-policy-binding gs://uiandwe-kafka-lab \--member="serviceAccount:kafka-sink@my-project.iam.gserviceaccount.com" \--role=".. [paper] Your Brain on ChatGPT: Accumulationof Cognitive Debt when Using an AIAssistant for Essay Writing Task Your Brain on ChatGPT: Accumulation of Cognitive Debt when Using an AI Assistant for Essay Writing Task 링크 : https://arxiv.org/abs/2506.088720. 핵심 요약이 논문은 LLM(ChatGPT)을 사용한 글쓰기가 실제 학습 능력과 인지 활동에 어떤 영향을 미치는지를 EEG(뇌파), NLP 분석, 인간 평가자 및 AI 평가자를 이용하여 측정한 연구연구진은 참가자를 3개 그룹으로 나누어 측정- LLM 그룹 : ChatGPT만 사용- 검색엔진 그룹 : Google 검색만 사용 (LLM 사용 금지)- Brain-only 그룹 : 어떠한 도구도 사용하지 않음참가자들은 3회 동안 동일한 방식으로 에세이를 작성했.. Kafka connect (3) - DLQ 관리 이번 글은 커넥트의 에러 처리 옵션으로 실패한 레코드를 DLQ(Dead Letter Queue) 토픽에 격리하고, 그 DLQ를 슬랙 알림, 마지막으로 재처리하는 것까지 정리 1. 커넥트의 에러 처리 ( fail fast, 무시, DLQ )커넥트의 에러 처리는 errors.tolerance 설정을 따른다.errors.tolerance=none (기본값) : 레코드 하나라도 실패하면 태스크가 즉시 FAILED. (그 즉시 해결할때까지 대기상태 -> 메시지가 추가되어도 계속 대기)errors.tolerance=all : 실패한 레코드를 건너뛰고 계속 진행. (무시하고 진행)all + errors.deadletterqueue.topic.name — 건너뛴 레코드를 지정한 토픽에 그대로 보관한다. (DLQ)DL.. 이전 1 2 3 4 ··· 159 다음