
들어가며
데이터 분석이나 머신러닝 프로젝트를 진행하기 전에 가장 많은 시간이 소요되는 작업 중 하나는 데이터 전처리(Data Preparation) 입니다.
누락된 값을 처리하거나, 컬럼 형식을 변경하고, 중복 데이터를 제거하는 등의 작업은 일반적으로 SQL이나 Python, Spark 코드를 작성해야 합니다.
AWS에서는 이러한 작업을 코드 없이 수행할 수 있도록 AWS Glue DataBrew를 제공합니다. DataBrew는 시각적인 UI를 이용해 데이터를 정제하고 변환할 수 있는 서비스이며, 자주 사용하는 전처리 작업을 미리 제공하여 누구나 쉽게 데이터 품질을 개선할 수 있습니다.
이번 글에서는 AWS Glue DataBrew의 개념과 주요 기능, 그리고 개인정보(PII) 처리 기능까지 살펴보겠습니다.
1. AWS Glue DataBrew란?

AWS Glue DataBrew는 코드를 작성하지 않고(No-Code) 데이터를 시각적으로 전처리할 수 있는 서비스입니다.
CSV, Parquet, JSON과 같은 파일이나 Amazon S3, Amazon Redshift, 데이터베이스 등의 데이터를 불러와 UI에서 직접 데이터를 정제할 수 있습니다. 또한 250개 이상의 내장 Transformation을 제공하여 데이터 정제 과정을 손쉽게 수행할 수 있습니다.
2. DataBrew의 주요 특징
2-1) 시각적인 데이터 전처리
DataBrew는 SQL이나 Python 코드를 작성하지 않고도 다양한 전처리 작업을 수행할 수 있습니다.
- 컬럼 삭제
- 컬럼 이름 변경
- NULL 값 처리
- 데이터 타입 변경
- 문자열 치환
- 날짜 형식 변경
- 중복 제거
모든 작업은 UI에서 선택만으로 수행할 수 있습니다.
2-2) 250개 이상의 Transformation 제공
DataBrew는 다양한 데이터 변환 기능을 기본 제공합니다.
- Filter
- Join
- Pivot
- Unpivot
- Sort
- Split
- Merge
- Aggregate
등의 작업을 코드 없이 수행할 수 있습니다.
2-3) Recipe
DataBrew에서는 수행한 전처리 작업을 Recipe라는 형태로 저장합니다.
- 어떤 컬럼을 삭제했는지
- 어떤 값을 변경했는지
- 어떤 필터를 적용했는지
등의 모든 작업 순서가 저장됩니다. 이후 동일한 데이터를 처리할 때 같은 Recipe를 다시 사용할 수 있습니다.
3. DataBrew 처리 과정
일반적인 DataBrew의 작업 흐름은 다음과 같습니다.

전처리 작업을 반복적으로 수행해야 하는 경우 Recipe를 그대로 재사용할 수 있어 작업 효율을 높일 수 있습니다.
4. DataBrew Recipe 예시
예를 들어 다음과 같은 주문 데이터가 있다고 가정해 보겠습니다.
| user_name | phone | amount |
| Kim | 010-1111-2222 | 10000 |
Recipe에서 다음 작업을 수행할 수 있습니다.
- phone 컬럼 삭제
- user_name 대문자 변환
- amount 컬럼 타입 변경
이러한 작업은 Recipe에 저장되어 이후에도 동일하게 적용됩니다.
5. 개인정보(PII) 처리
DataBrew는 개인정보 보호를 위한 다양한 기능을 제공합니다.
5-1) Masking
개인정보 일부를 숨깁니다.
010-1234-5678
↓
010-****-5678
5-2) Hashing
원래 값을 복원할 수 없는 해시값으로 변환합니다.
user@email.com
↓
f0e91acb...
5-2) Encryption

민감한 데이터를 암호화하여 저장합니다. 복호화 권한이 있는 사용자만 원본 데이터를 확인할 수 있습니다.
5-4) Delete
민감한 컬럼 자체를 삭제합니다.
- 주민등록번호
- 카드번호
- 이메일
등을 완전히 제거할 수 있습니다.
5-5) Random Replace
원래 값을 임의의 값으로 변경합니다.
홍길동
↓
김민수
실제 데이터를 다른 값으로 치환하여 테스트 데이터를 생성할 수 있습니다.
6. DataBrew 활용 예시
쇼핑몰 고객 데이터를 전처리한다고 가정해 보겠습니다.

DataBrew에서
- 전화번호 마스킹
- 이메일 삭제
- NULL 제거
- 날짜 형식 변경
을 수행한 뒤 Amazon S3 또는 Amazon Redshift에 저장할 수 있습니다. 이를 통해 개인정보를 보호하면서 분석용 데이터를 쉽게 생성할 수 있습니다.
7. AWS Glue ETL과 차이점
| AWS Glue ETL | AWS Glue DataBrew |
| PySpark 기반 | UI 기반 |
| 코드 작성 필요 | 코드 작성 불필요 |
| 대규모 ETL 처리 | 데이터 전처리 중심 |
| 개발자 중심 | 데이터 분석가도 사용 가능 |
| 복잡한 로직 구현 가능 | 시각적인 Transformation 제공 |
Glue ETL은 대규모 데이터 파이프라인 구축에 적합하며, DataBrew는 데이터를 빠르게 정제하고 분석용 데이터셋을 준비하는 데 적합합니다.
8. 언제 사용할까?
- 데이터 분석 전 전처리
- 머신러닝 학습 데이터 준비
- CSV 데이터 정리
- 개인정보 비식별 처리
- 데이터 품질 개선
- 반복적인 데이터 정제 작업 자동화
9. 마치며
이번 글에서는 AWS Glue DataBrew의 기본 개념과 주요 기능을 살펴보았습니다.
처음에는 단순한 데이터 전처리 도구라고 생각했지만, 학습하면서 코드 없이 다양한 Transformation을 적용하고, Recipe를 통해 동일한 전처리 과정을 반복 실행할 수 있는 서비스라는 점을 이해할 수 있었습니다.
또한 개인정보 마스킹, 해싱, 암호화와 같은 PII 처리 기능을 제공하여 분석용 데이터를 안전하게 준비할 수 있으며, Data Quality 기능을 활용해 데이터 품질까지 함께 관리할 수 있다는 점도 알게 되었습니다.
Glue ETL이 대규모 데이터 파이프라인 구축에 적합하다면, DataBrew는 데이터를 빠르게 정제하고 분석에 활용할 수 있도록 준비하는 데 강점을 가진 서비스라고 볼 수 있습니다.
'Data Engineering > AWS' 카테고리의 다른 글
| AWS Athena란 (0) | 2026.07.21 |
|---|---|
| AWS Lake Formation이란 (0) | 2026.07.20 |
| AWS Glue Jobs & AWS Glue Data Quality(DQDL) (0) | 2026.07.20 |
| AWS Glue ETL | DynamicFrame과 주요 Transformation 이해하기 (0) | 2026.07.15 |
| Amazon EKS란 (0) | 2026.07.09 |