AWS Athena란

2026. 7. 21. 15:25·Data Engineering/AWS

들어가며

데이터를 분석하기 위해서는 일반적으로 데이터베이스에 데이터를 적재한 후 SQL을 실행해야 합니다. 하지만 로그 파일이나 CSV, JSON, Parquet와 같은 대용량 파일을 분석하기 위해 매번 데이터베이스를 구축하는 것은 시간과 비용이 많이 듭니다.

 

AWS에서는 이러한 문제를 해결하기 위해 Amazon Athena를 제공합니다.

Athena는 Amazon S3에 저장된 데이터를 별도의 데이터베이스로 이동하지 않고 SQL만으로 바로 조회할 수 있는 서버리스(Serverless) 분석 서비스입니다.

 

이번 글에서는 Athena의 기본 개념과 동작 방식, 그리고 AWS Glue와 함께 사용하는 이유까지 입문자의 관점에서 살펴보겠습니다.


1. Amazon Athena란?

https://medium.com/%40yogeshsachan/aws-glue-job-bookmarks-explained-with-netflix-time-machines-a-bit-of-magic-ab2a86ffffcc

Athena는 Amazon S3에 저장된 데이터를 SQL로 조회할 수 있는 서버리스(Serverless) 쿼리 서비스입니다.

일반적인 데이터베이스는 데이터를 먼저 적재한 후 SQL을 실행하지만, Athena는 데이터를 S3에 그대로 둔 상태에서 SQL을 실행합니다. 즉, 데이터를 복사하거나 별도의 데이터베이스를 구축하지 않아도 S3에 저장된 파일을 바로 분석할 수 있습니다.

 

또한 서버를 직접 생성하거나 관리할 필요 없이 필요한 순간에만 쿼리가 실행되며, 작업이 끝나면 자동으로 리소스가 정리됩니다.

Athena는 내부적으로 Presto(현재 Trino 계열) 분산 SQL 엔진을 기반으로 동작하기 때문에 대용량 데이터도 빠르게 조회할 수 있습니다.


2. Athena의 주요 특징

2-1) 서버리스(Serverless)

EC2를 생성하거나 데이터베이스 서버를 구축할 필요가 없습니다.

SQL을 실행하면 AWS가 필요한 컴퓨팅 자원을 자동으로 준비하고 작업이 끝나면 정리합니다.

2-2) S3 데이터를 그대로 조회

https://shiftasia.com/community/enabling-cloudfront-access-logs-and-querying-with-athena-using-projected-partitions/

Athena는 데이터를 데이터베이스로 옮기지 않습니다. S3에 저장된 데이터를 그대로 읽어 SQL을 수행합니다.

따라서 데이터 적재 시간이 필요하지 않으며, 데이터 레이크(Data Lake) 환경에서 자주 사용됩니다.

2-3) 다양한 파일 형식 지원

Athena는 다양한 데이터 형식을 지원합니다.

  • CSV
  • TSV
  • JSON
  • Parquet
  • ORC
  • Avro

또한 Gzip, Snappy 등 압축 파일도 그대로 조회할 수 있습니다.

2-4) 다양한 데이터 구조 지원

Athena는 다음과 같은 데이터 형태를 모두 처리할 수 있습니다.

  • 정형 데이터(Structured)
  • 반정형 데이터(Semi-Structured)
  • 비정형 데이터(Unstructured)

예를 들어 JSON 로그 파일이나 CSV 파일도 SQL로 조회할 수 있습니다.


3. Athena는 어떻게 동작할까?

https://mfarache.github.io/mfarache/Query-S3-Athena-AWS-Glue/

Athena의 데이터 조회 과정은 매우 단순합니다.

  1. 데이터를 Amazon S3에 저장합니다.
  2. AWS Glue Data Catalog에 테이블 정보를 등록합니다.
  3. Athena에서 SQL을 실행합니다.
  4. Athena가 S3 데이터를 읽어 결과를 반환합니다.

즉, 실제 데이터는 계속 Amazon S3에 저장되어 있으며, Athena는 필요한 데이터만 읽어서 결과를 반환합니다.

이처럼 데이터를 이동하지 않고 필요한 순간에만 읽기 때문에 데이터 레이크 환경에 적합합니다.


4. Athena 활용 사례

4-1) 웹 로그 분석

https://medium.com/endtoenddata/aws-glue-crawlers-that-will-save-you-hours-of-manual-work-860d0b96d1c9

웹 서버에서 생성되는 로그를 Amazon S3에 저장한 뒤 SQL을 이용하여 접속 수, 오류 발생 건수 등을 분석할 수 있습니다.

4-2) Redshift 적재 전 데이터 확인

https://dzone.com/articles/etl-data-modeling-for-sample-crypto-data?

ETL 과정에서 Amazon Redshift에 적재하기 전에 S3의 데이터를 SQL로 미리 검증할 수 있습니다.

4-3) AWS 서비스 로그 분석

Athena는 다양한 AWS 서비스 로그를 분석하는 데 많이 사용됩니다.

  • CloudTrail
  • CloudFront
  • VPC Flow Logs
  • ELB Logs

등을 SQL만으로 조회할 수 있습니다.

4-4) 데이터 분석 도구 연동

https://aws.amazon.com/ko/blogs/machine-learning/data-visualization-and-anomaly-detection-using-amazon-athena-and-pandas-from-amazon-sagemaker/

Athena는 다양한 분석 도구와 연동됩니다.

  • Jupyter Notebook
  • Zeppelin
  • RStudio

등에서 SQL을 실행할 수 있습니다.

4-5) Amazon QuickSight 연동

Athena에서 조회한 데이터를 QuickSight와 연결하여 대시보드를 만들 수 있습니다.


5. Athena와 AWS Glue

https://medium.com/%40shreya.maher/unveiling-coffee-distribution-insights-with-aws-a-step-by-step-guide-8bd76cf4c660

Athena는 AWS Glue와 함께 사용하는 경우가 대부분입니다. Athena는 SQL을 실행하는 서비스이고, Glue는 데이터의 메타데이터를 관리합니다.

즉, Athena는 Glue Data Catalog에 저장된 테이블 정보를 참고하여 S3 데이터를 조회합니다.

  1. 데이터를 Amazon S3에 저장합니다.
  2. Glue Crawler가 데이터를 분석합니다.
  3. AWS Glue Data Catalog의 메타데이터를 참고하여 S3 데이터를 SQL로 조회합니다.
  4. 필요하면 QuickSight에서 시각화합니다.

Glue가 없다면 Athena는 S3의 파일이 어떤 형식이고 어떤 컬럼으로 구성되어 있는지 알 수 없습니다.

따라서 대부분의 데이터 레이크 환경에서는 Glue와 Athena를 함께 사용합니다.


6. 언제 Athena를 사용할까?

Athena는 다음과 같은 상황에서 적합합니다.

  • Amazon S3에 저장된 데이터를 바로 분석하고 싶은 경우
  • 로그 데이터를 SQL로 조회하고 싶은 경우
  • 데이터 레이크 환경에서 분석을 수행하는 경우
  • 데이터베이스를 구축하지 않고 빠르게 분석하고 싶은 경우
  • 일회성 분석이나 탐색(Query)이 필요한 경우

반면 데이터를 수정하거나 대량의 ETL 작업을 수행하는 용도라면 Athena보다 AWS Glue가 더 적합합니다.


7. Athena와 데이터베이스의 차이

Athena는 SQL을 사용한다는 점에서는 데이터베이스와 비슷하지만 목적은 다릅니다.

구분 Amazon Athena 일반 데이터베이스
데이터 저장 Amazon S3 자체 스토리지
데이터 이동 필요 없음 먼저 적재 필요
서버 관리 불필요 필요
주요 목적 데이터 분석 서비스 운영 및 트랜잭션
사용 방식 SQL 조회 SQL 조회 및 데이터 변경

즉, Athena는 데이터를 저장하는 서비스가 아니라 S3 데이터를 분석하는 서비스라고 이해하면 됩니다.


8. 마치며

이번 글에서는 Amazon Athena의 기본 개념과 동작 방식을 살펴보았습니다.

 

처음에는 단순히 SQL을 실행하는 서비스라고 생각했지만, 학습하면서 Amazon S3에 저장된 데이터를 별도의 적재 과정 없이 조회할 수 있는 서버리스 분석 서비스라는 점을 이해할 수 있었습니다.

 

또한 Athena는 AWS Glue Data Catalog와 함께 사용하여 S3 데이터의 메타데이터를 관리하고, SQL 기반 분석을 수행할 수 있다는 점도 알게 되었습니다.

 

데이터 레이크 환경에서는 로그 분석이나 대용량 파일 조회와 같은 작업이 자주 발생하는 만큼, Athena는 데이터를 빠르게 탐색하고 분석하는 데 유용한 서비스라고 볼 수 있습니다.

'Data Engineering > AWS' 카테고리의 다른 글

Apache Iceberg와 Glue Data Catalog 연동 이해하기  (0) 2026.07.22
AWS Athena | Workgroup, 비용 최적화, 보안  (0) 2026.07.21
AWS Lake Formation이란  (0) 2026.07.20
AWS Glue DataBrew란  (0) 2026.07.20
AWS Glue Jobs & AWS Glue Data Quality(DQDL)  (0) 2026.07.20
'Data Engineering/AWS' 카테고리의 다른 글
  • Apache Iceberg와 Glue Data Catalog 연동 이해하기
  • AWS Athena | Workgroup, 비용 최적화, 보안
  • AWS Lake Formation이란
  • AWS Glue DataBrew란
jjaehyeok
jjaehyeok
jjaehyeok 님의 블로그 입니다.
  • jjaehyeok
    jjaehyeok 님의 블로그
    jjaehyeok
  • 전체
    오늘
    어제
    • 분류 전체보기 (116) N
      • Navisafe (16)
        • Infrastructure (14)
        • Data Pipeline (0)
        • Trouble shooting (2)
      • Data Engineering (63) N
        • Airflow (11)
        • Kafka (3)
        • Spark (1) N
        • ELK (2)
        • Kubernetes (7)
        • AWS (39) N
        • Flink (0)
      • CodingTest (31)
        • 문제 풀이(Lv1~Lv2) (21)
        • 문제 풀이(Lv3) (10)
        • SQL (0)
      • 알고리즘 정리 (3)
        • 자료구조 (스택, 큐, 해시) (3)
        • 정렬 & 그리디 (0)
        • DFS & BFS (0)
        • 이분탐색 (0)
        • DP (0)
      • 자격증 (1)
        • CKAD (1)
        • DEA-C01 (0)
  • 블로그 메뉴

    • 홈
    • 태그
    • 방명록
  • 링크

  • 공지사항

  • 인기 글

  • 태그

    CKAD
    trouble shooting
    Redshift
    Kafka
    Airflow
    drea-c01
    eks
    DynamoDB
    DEA-C01
    EC2
    datasync
    elk
    S3
    Athena
    AWS
    Glue
    datatransfer
    k8s
    documentdb
    ECR
  • 최근 댓글

  • 최근 글

  • hELLO· Designed By정상우.v4.10.6
jjaehyeok
AWS Athena란
상단으로

티스토리툴바