프로젝트 사전 양식 클릭 다운로드하세요. 해당 양식은 반드시 다운로드후 본인 컴에 새이름으로 저장한 파일에 작성하셔야 합니다. 이곳에 그냥 작성을 하면 모든 학생들이 보는 이 파일에 본인 내용이 업데이트되니 반드시 주의하세요. (실제 그런 경우가 있었어요....)
2021년 4월 14일 수요일
2021년 4월 12일 월요일
불용어 처리 / 비즈니스 불용어 사전 개발 Ver. 1
한글 비즈니스 불용어 전처리 분석하고자 하는 텍스트 데이터 중 분석에 도움이 되지 않는 불필요한 텍스트불용어(Stopwords)들을 최대한 제거하는 과정은 데이터 분석의 정확성을 높이고, 분석 비용 (시간, 컴퓨팅 리소스등)을 줄이기 위해 매우 중요하다. 하지만, 분석 목적에 따라 또 언어에 따라 불용어가 다르기 때문에, 생성AI등이 알아서 할 수 없는 …
2020년 6월 4일 목요일
텍스트 전처리 과정에 대해 대강 이해하기 (개괄)
크롤링한 텍스트 데이타를 가지고 본격적인 분석을 하기전에 분석에 도움이 되지 않는 데이타를 최대한 제거하는 과정이 필요합니다. 이 과정을 데이타 전처리 과정이라고 합니다. 이해를 쉽게 하기 위해 예를 가지고 설명을 하지요. 스타벅스라는 커피 전문점에서 카페 브랜드에 대한 소비자 인식, 이미지를 분석하는 상황을 가정해 보지요. 이를 위해 '카페…
2020년 5월 5일 화요일
유닛(분석단위) 정제 (코드: 파이썬): 동일 메시지 중복 제거하기
CraledTexts.csv 에 존재할 수 있는 중복된 메세지를 제거한다. 효과: 광고, 상업적 알바 글, 프로그램이 자동으로 작성한 글 등 불필요한 메시지 제거
아이디어: 과부하와 속도를 위해 메세지 전체를
비교하지 않고 첫 몇 글자를 비교해 특정수 이상 같다면 같은 메세지로 치부하고 제거한다. 필요 파일: 수집한 텍스트파일 CraledTexts.csv
코드: 개발자 (J…
유닛(분석단위) 표준화 (코드: 파이썬): 표현 바꾸기
목적 : 단어 표준화 (Normalization: Lemmatization의 상위 개념) 같은 단어를 다른 형태로 쓰기 때문에, 이를 가능한한 단일 표현으로 통일(표준화) 해야 한다. 이를 normalization 라고 일컫는다. 이미 koNLPY의 여러 메소드(Okt, Mecab 등)에서 형태소 바탕으로 어근을 추출하여, 사용하는 경우가 많은데, 우리는 가급적…