전체 글82 3. 데이터 탐색(집계, 그룹화) 1. 집계- 집계란, 이미 된 계산들을 한데 모아서 계산함. 또는 그런 계산- 집계함수(Aggregate Function)함수기능설명COUNT()개수 구하기행(Row)의 개수를 샌다.SUM()합계 구하기숫자 컬럼의 모든 값을 더한다.AVG()평균 구하기숫자 컬럼의 평균값을 계산한다.MAX()최댓값 구하기해당 컬럼에서 가장 큰 값을 찾는다.MIN()최솟값 구하기해당 컬럼에서 가장 작은 값을 찾는다. 2. 아래와 같은 테이블(PRODUCT_SALES)이 있다고 가정하에 함수별 사용 예시order_idproduct_namesalesprice1laptop115000002mouse3300003keyboard2100000-- COUNT: 전체 데이터가 몇 건인가?SELECT COUNT(*) FROM PRODUCT.. 2025. 12. 22. 2. 데이터 저장 형태와 데이터 탐색(조건과 추출) 1. 데이터는 보통 데이터베이스 테이블 등에 저장한다.- Database: 데이터의 저장소- Table: 데이터가 저장된 공간- 저장된 데이터를 제품(앱, 웹)에서 사용 2. Oracle, MySQL, PostgreSQL 같은 데이터베이스의 특징- OLTP(Online Transction Processing)- 목적: 일상적인 업무 운영 및 기록- 주요 작업: 데이터 입력, 수정, 삭제- 실시간으로 지금 당장 발생하는 수많은 데이터를 처리 3. SQL(Structured Query Language)- 데이터베이스와 대화하기 위해 만들어진 표준 언어- OLTP(Oracle, MySQL), OLAP(BigQuery) 모두 SQL을 사용 4. 테이블에 저장된 데이터의 형태- 테이블 구조 Column 1C.. 2025. 12. 22. 1. Google BigQuery 란 구글 빅쿼리(Google BigQuery)는 테라바이트(TB)에서 페타바이트(PB)급의 대규모 데이터를 몇 초 만에 처리할 수 있는 클라우드 기반의 완전 관리형 데이터 웨어하우스이다. 빅쿼리가 데이터 분석 시장에서 강력한 도구로 평가받는 주요 장점들은 다음과 같다. 1. 인프라 관리가 필요 없는 '서버리스(Serverless)'빅쿼리의 가장 큰 특징 중 하나는 서버를 설치하거나 설정할 필요가 없다는 점이다.- 하드웨어 관리, 클러스터 구성 등을 구글이 대신 처리하므로 데이터 분석에만 집중 가능하다.- 데이터의 크기가 급격히 늘어나도 시스템이 알아서 자원을 할당하여 성능을 유지한다. 2. 압도적인 데이터 처리 속도구글의 분산 컴퓨팅 기술을 사용하여 수천억 개의 행을 가진 테이블도 수 초 내에 스캔 가능.. 2025. 12. 22. [Kaggle] Intro to SQL Kaggle 사이트의 Into to SQL coures를 통해서 이것저것 공부 해보고자 한다.해당 코스는 SQL과 BigQuery를 배울 수 있다고 한다. 그러면 이제 가장 첫 과정부터 시작해 보자 1.BigQuery를 사용하기 위에서는 아래의 패키지를 import 해야 한다.from google.cloud import bigquery 2. client라는 object를 만들어줘야 한다.client = bigquery.Client() client object는 BigQuery 데이터셋에서 정보를 찾는데 중요한 역할을 한다고 한다.아직은 정확히는 모르겠지만 실습을 위해서 일단 넘어가고 나중에 다시 알아보자 3. 참조 생성 및 요청 dataset_ref = client.dataset("데이터셋_이름",.. 2025. 8. 13. [데이터 분석] 두번째 가설 검증하기 나의 첫 데이터 프로젝트 마지막 과정이다. 예시 데이터가 적당하지 않아 reindex()를 해도 나의 데이터 프레임은 그대로였다...하지만! 나중을 위한 습관이라 생각하고 일단 알아보고 사용했다.찾다 보니 set_index라는 것도 알게 되었으나 현재 나의 프로젝트에선 불필요했으므로 나중에 다시 알아보기로 한다. # 표준 라이브러리 임포트는 없다고 가정# 서드파티 라이브러리 임포트 (알파벳 순)import matplotlib.pyplot as pltimport pandas as pdimport seaborn as sns# 로컬 애플리케이션/라이브러리 특정 임포트는 없다고 가정# # matplotlib 라이브러리 한글 폰트 깨짐 방지 용도# plt.rcParams['font.family'] ='Malgun.. 2025. 8. 12. [데이터 분석] 바 그래프를 통해 가장 많이 팔린 메뉴를 알아보자 개인 사정으로 인하여 앞으로는 로컬환경에서 Kaggle notebook으로 바꾸어 진행하고자 한다# 표준 라이브러리 임포트는 없다고 가정# 서드파티 라이브러리 임포트 (알파벳 순)import matplotlib.pyplot as pltimport pandas as pdimport seaborn as sns# 로컬 애플리케이션/라이브러리 특정 임포트는 없다고 가정# # matplotlib 라이브러리 한글 폰트 깨짐 방지 용도# plt.rcParams['font.family'] ='Malgun Gothic'# plt.rcParams['axes.unicode_minus'] =False# 1.데이터 불러오기 및 데이터 확인# df = pd.read_csv('sales_data.csv')df = pd.read_c.. 2025. 8. 11. 이전 1 2 3 4 ··· 14 다음