본문 바로가기

전체 글

(1263)
Kafka connect (4) - kafka connect to gcs 파일 저장 sink 커넥터로 토픽 메시지를 parquet 파일로 만들어 GCS 버킷에 적재한다.parquet + 날짜 파티션 경로로 잘라두면 이후 spark나 BigQuery external table이 바로 읽을 수 있도록 저장한다. 1. 준비$ gcloud storage buckets create gs://uiandwe-kafka-lab --location=us 권한이 있는 서비스키로 준비 SA 키 파일을 broker 컨테이너 안으로 복사$ gcloud storage buckets add-iam-policy-binding gs://uiandwe-kafka-lab \--member="serviceAccount:kafka-sink@my-project.iam.gserviceaccount.com" \--role="..
[paper] Your Brain on ChatGPT: Accumulationof Cognitive Debt when Using an AIAssistant for Essay Writing Task Your Brain on ChatGPT: Accumulation of Cognitive Debt when Using an AI Assistant for Essay Writing Task 링크 : https://arxiv.org/abs/2506.088720. 핵심 요약이 논문은 LLM(ChatGPT)을 사용한 글쓰기가 실제 학습 능력과 인지 활동에 어떤 영향을 미치는지를 EEG(뇌파), NLP 분석, 인간 평가자 및 AI 평가자를 이용하여 측정한 연구연구진은 참가자를 3개 그룹으로 나누어 측정- LLM 그룹 : ChatGPT만 사용- 검색엔진 그룹 : Google 검색만 사용 (LLM 사용 금지)- Brain-only 그룹 : 어떠한 도구도 사용하지 않음참가자들은 3회 동안 동일한 방식으로 에세이를 작성했..
Kafka connect (3) - DLQ 관리 이번 글은 커넥트의 에러 처리 옵션으로 실패한 레코드를 DLQ(Dead Letter Queue) 토픽에 격리하고, 그 DLQ를 슬랙 알림, 마지막으로 재처리하는 것까지 정리 1. 커넥트의 에러 처리 ( fail fast, 무시, DLQ )커넥트의 에러 처리는 errors.tolerance 설정을 따른다.errors.tolerance=none (기본값) : 레코드 하나라도 실패하면 태스크가 즉시 FAILED. (그 즉시 해결할때까지 대기상태 -> 메시지가 추가되어도 계속 대기)errors.tolerance=all : 실패한 레코드를 건너뛰고 계속 진행. (무시하고 진행)all + errors.deadletterqueue.topic.name — 건너뛴 레코드를 지정한 토픽에 그대로 보관한다. (DLQ)DL..
Kafka connect (2) - SMT(single message Transform) 지난 글에서 FileStreamSinkConnector로 토픽 메시지를 파일로 저장하는 작업을 진행했다. 이번에는 커넥터에 SMT(Single Message Transform)를 추가해서 메시지를 변형해보는것을 진행한다. 컨슈머 코드 없이 json 설정만으로 필드를 추가, 삭제, 변경한다. 사용할 트랜스폼은 두가지 InsertField$Value : 타임스탬프, 고정값, kafka 메타(topic/partition/offset) 필드 추가ReplaceField$Value : 필드 제거, 필드 이름 변경 1. SMTsink 커넥터 기준으로 메시지 흐름은 다음과 같다. kafka topic → converter (bytes → map/struct) → transform 체인 → sink task co..
Kafka connect (1) - 시작 https://docs.confluent.io/platform/current/connect/references/restapi.html#connectorshttps://docs.redhat.com/ko/documentation/red_hat_streams_for_apache_kafka/2.4/html/using_amq_streams_on_rhel/assembly-kafka-connect-distributed-str 8.2. 분산 모드에서 Kafka Connect 사용 | RHEL에서 AMQ Streams 사용 | Streams for Apache Kafka | 2.4 | Red Hat Documen분산 모드에서 Kafka Connect는 작업자 프로세스 클러스터로 실행되며 각 작업자는 별도의 노드에서 실행..
[paper] The Dataflow Model: A Practical Approach to BalancingCorrectness, Latency, and Cost in Massive-Scale,Unbounded, Out-of-Order Data Processing 이번주 논문은 apache beam의 기초가 된는 Dataflow Model에 대한 설명 논문 입니다. https://www.vldb.org/pvldb/vol8/p1792-Akidau.pdf 1. 기존 문제점- "언젠가 데이터가 모두 모인다"의 전제로 데이터파이프라인 구성- 서비스 로그, 모바일 로그, 센서 데이터의 경우 순서가 뒤섞이며, 늦게 도착해 수정/취소 될수 있음 - MapReduce, Hadoop, Pig, Hive, Spark 등은 모든 입력을 모은 뒤 처리해야 하므로 지연시간 문제 발생- 스트리밍 시스템은 낮은 지연시간을 제공할 수 있지만, 정확성, 장애 내성, exactly-once semantics, event-time 기반 windowing 등 한계 발생 - lamdba 아키텍처는..
[paper] Dremel: Interactive Analysis of Web-Scale Datasets 이번주 논문은Dremel: Interactive Analysis of Web-Scale Datasetshttps://storage.googleapis.com/gweb-research2023-media/pubtools/3293.pdfDremel은 구글이 2010년 발표한 논문에서 소개된 기술로, 대규모의 데이터를 분석할 수 있도록 설계된 확장 가능한 대화형 쿼리 시스템설계입니다 (빅쿼리의 근간이 되는 논문)1. 기존 문제점MapReduce는 대규모 데이터를 안정적으로 처리하는 데는 좋지만 기본적으로 배치 처리 모델.쿼리 하나를 실행할 때마다 job을 만들고 데이터를 읽고 map/reduce 단계를 수행하고, 중간 결과를 저장하거나 다음 job으로 넘기는 작업으로 ad-hoc 분석에 지연이 발생됨.또한 중첩..
위성영상 정유탱크 객체 판독 해당 내용의 데이터는 ai hub 위성 영상 객체 판독을 사용했음. 링크 AI-Hub데이터셋 다운로드 승인이 완료 된 후 API 다운로드 서비스를 이용하실 수 있습니다. API 다운로드 파일은 분할 압축되어 다운로드 됩니다. 분할 압축 해제를 위해서는 분할 압축 파일들의 병합이aihub.or.kr 1. 문제와 데이터아리랑(KOMPSAT) 3/3A호 위성영상에서 정유탱크(storage tank)를 검출을 목표로 한다.평가 지표는 AP @ IoU > 0.5 — 예측 박스와 정답 박스가 절반 넘게 겹치면 맞춘 것으로 치고 계산한 Average Precision 원본은 AI Hub 위성영상객체판독 데이터셋에는 20개 클래스에 객체 502,248개가 들어있는데, 정유탱크는 그중 0.42%뿐이다. 전체 패치 (1..