통계 - 정형 데이터
AI - 비정형 데이터
- Feature Extraction: 비정형 데이터를 벡터로
- Text Representation: 벡터로 변경한 비정형 텍스트 데이터
- 방법 3가지
- Simple word counting
- Context-free embedding
- Conntext-based embedding
- 방법 3가지
- Text Representation: 벡터로 변경한 비정형 텍스트 데이터
방법 3가지
- Simple word counting
- Bag-og-Words(BoW)
- 단어를 딕션어리로 만들고, 문장에서 단어가 언급된 갯수를 세서 벡터 형성
- Self-supervised learning
- 통계모델
- Context Words(단어를 감싸는 양쪽 단어들) 을 보고 어떤 단어가 올지 예측
- One-Hot Encoding
- BoW의 단어 빈도수를 벡터로 형성한거에서
- 빈도수는 빼고 나오면 1로 안나오면 0으로 표기
- TF-IDF
- Bag-og-Words(BoW)
- Context-free embedding
- 위의 Self-supervised learning 모델을 통해서
- Context Words에서 단어 예측을 통해서 단어 사이의 거리를 알 수 있게 되었고
- Embedding 기법이 발견
- Word2vec (Google)
- 위의 Self-supervised learning 모델을 통해서
- Conntext-based embedding
- BERT (Google)
'4th > 빅데이터' 카테고리의 다른 글
| [2023-09-13][3주차] (0) | 2023.09.13 |
|---|---|
| [2023-09-06][2주차] (0) | 2023.09.06 |