전체 글 19

문장 유사도 - 자카드 지수

문장 간 유사도는 공통된 단어 혹은 의미를 기반으로 계산 자카드 지수 문장 간 공통된 단어의 비율로 문장 간 유사도를 정의 (0~1 사이로 정의)코사인 유사도  코사인 유사도는 고차원의 공간에서 벡터 간의 유사성을 잘 보존하는 장점이 있음 자카드 지수로 문장 유사도 측정하기--------------------------------------------------------------------------------------------------------------------전체 코드 ♥sent1 = "지우는 오늘 밥을 너무 마니 먹어서 힘들다"sent2 = "지우는 오늘 나랑 놀기로 했는데 안놀았다"def cal_jaccard_sim(sent_1,sent_2): word_sent1 = set(s..

딥러닝 2025.01.21

soynlp

soynlp는 한국어 단어 추출 중 발생할 수 있는 미등록 단어 문제를 해결할 수 있는 전처리 라이브러리soynlp는 학습 데이터에서 자주 발생하는 패턴을 기반으로 단어의 경계선을 구분하여 단어를 추출----------------------------------------------------------------------------------------------------------------------------------------------실습에서는 신문 기사를 학습 데이터로 사용하여 명사 목록을 학습한 뒤, 주어진 문장에서 명사를 추출할 예정from soynlp.utils import DoublespaceLineCorpus from soynlp.word import WordExtractorf..

딥러닝 2025.01.21

Konlpy

Kkmasent = "안녕 나는 김지우야 반가워. 너의 이름은 뭐야?"kkma = Kkma()print(kkma.nouns(sent))print(kkma.pos(sent))print(kkma.sentences(sent)) 명사 추출 (nouns)품사 태깅 (pos)문장 분리 (sentences) ['안녕', '나', '김', '김지우', '지우', '너', '이름', '뭐'][('안녕', 'NNG'), ('나', 'NP'), ('는', 'JX'), ('김', 'NNG'), ('지우', 'NNG'), ('야', 'JX'), ('반갑', 'VA'), ('어', 'ECS'), ('.', 'SF'), ('너', 'NP'), ('의', 'JKG'), ('이름', 'NNG'), ('은', 'JX'), ('뭐', '..

딥러닝 2025.01.21

나이브 베이즈

[텍스트1] : 영상미가|뛰어나고|너무너무|재밌어요p(감정|텍스트) =? 나이브베이즈 기반 감정 분석은 주어진 텍스트가 특정 감정을 나타낼 확률을 예측하는 문제로 정의 베이즈 정리를 사용하여 텍스트의 감정 발생 확률을 추정 텍스트가 주어졌을 때 감정을 맞추기   [텍스트1] : 영상미가|뛰어나고|너무너무|재밌어요[텍스트 1의 감정] : 해당 감정 내 단어들이 발생할 가능성 x 감정의 발생 확률 감정의 발생 확률과 텍스트를 구성하는 단어들의 가능도(likehood)나이브 베이즈 학습나이브 베이즈 기법에서는 각 감정 내 단어의 가능도(likelihood) 를 기반으로 문장의 감정을 예측 감정 내 단어의 가능도 공식 P^(단어|감정)=감정 내 모든 단어의 빈도수/ 감정 내 단어의 빈도수import pandas..

딥러닝 2025.01.21

감정분석 서비스 - 데이터 분할

1) 모델 학습을 위한 데이터 분할(test) 학습 데이터란 감정 분석 모델을 훈련 시키기 위해 문장과 해당 문장의 감정이 포함되어 있는 데이터셋을 의미(train) 평가 데이터란 학습된 모델의 성능을 평가하기 위해 학습에 포함되지 않은 데이터셋을 의미i didnt feel humiliated;sadness i can go from feeling so hopeless to so damned hopeful just from being around someone who cares and is awake;sadness im grabbing a minute to post i feel greedy wrong;anger i am ever feeling nostalgic about the fireplace i wil..

딥러닝 2025.01.20

FastText

FastText 학습 데이터 내 존재하지 않았던 단어 벡터는 생성할 수 없는 문제-> 미등록단어문제 , out of vocabulary이 문제를 해결한 것이 FastText from gensim.models import FastTextdoc = [['서울에','살고','있는','지우는','강아지를','좋아한다']]ft_model = FastText(min_count=1, window=2,vector_size= 300)ft_model.build_vocab(doc) # 수치형 데이터로 변환 ft_model.train(doc,total_examples=ft_model.corpus_count,epochs=20)similar_word = ft_model.wv.most_similar("앨리스는")print(simi..

딥러닝 2025.01.19