본문 바로가기
4th/빅데이터

[6주차] Feature Extraction

by dfmba-taegu 2023. 10. 4.

통계 - 정형 데이터

AI - 비정형 데이터 

  • Feature Extraction: 비정형 데이터를 벡터로
    • Text Representation: 벡터로 변경한 비정형 텍스트 데이터
      • 방법 3가지
        • Simple word counting
        • Context-free embedding
        • Conntext-based embedding

 

방법 3가지

  • Simple word counting
    • Bag-og-Words(BoW)
      • 단어를 딕션어리로 만들고, 문장에서 단어가 언급된 갯수를 세서 벡터 형성 
      • Self-supervised learning
        • 통계모델
        • Context Words(단어를 감싸는 양쪽 단어들) 을 보고 어떤 단어가 올지 예측
    • One-Hot Encoding
      • BoW의 단어 빈도수를 벡터로 형성한거에서
      • 빈도수는 빼고 나오면 1로 안나오면 0으로 표기 
    • TF-IDF
  • Context-free embedding
    • 위의 Self-supervised learning 모델을 통해서 
      • Context Words에서 단어 예측을 통해서 단어 사이의 거리를 알 수 있게 되었고
      • Embedding 기법이 발견 
    • Word2vec (Google)
  • Conntext-based embedding
    • BERT (Google)

 

'4th > 빅데이터' 카테고리의 다른 글

[2023-09-13][3주차]  (0) 2023.09.13
[2023-09-06][2주차]  (0) 2023.09.06