본문 바로가기

전체 글

(7)
Git Hub - 1 깃허브에 처음 로그인 시 좌측 상단의 Dashboard 아래 다음과 같은 버튼을 확인할 수 있다.  이후 New 버튼을 누르게 되면 아래와 같은 화면으로 넘어간다.  이 화면에서 확인해야 할 것은 5가지가 있다.  첫 번째 빨간 박스 부분은 Repository name이다.이 부분은 단순하게 이름이라고 생각하고 넘어가도 괜찮지만 주의할 점 몇 가지가 존재한다.100글자 이내 , 영어 소문자와 숫자, 하이픈(-)과 밑줄(_)과 점(.)의 사용이 가능하다.이때 Repository name에서 공백은 사용 불가능하니 하이픈, 밑줄, 점을 사용해주어야 한다. 두 번째 박스의 내용은 Public과 Private로 공개성 여부 확인이다.Public으로 설정 시 모든 인터넷 사용자가 저장소를 확인할 수 있지만 , P..
NLP - 3 언어 모델 : 단어 시퀀스에 확률을 부여하는 모델결합 확률 수식문장에서 i 번째로 등장하는 단어 : wi단어 개수 : n$$P( w_1,w_2,w_3,w_4,...,w_n) $$ P(A,C) 보다는 P(B,C)가 자연스러운 연결이 때 B 다음 C가 나타날 확률의 정의를 조건부 확률(conditional probability)이라고 함$$ P(A|B) = \frac{P(A,B)}{ P(B)}$$ 단어 3개가 동시에 등장할 결합 확률$$ P(w_1,w_2,w_3) = P(w_1) \times P(w_2|w_1) \times P(w_3|w_1,w_2)$$ 즉 첫 번째 단어 등장 이후 두 번째 단어 등장 이후 세 번째 단어 등장의 등장이라는 3가지 사건이 동시에 일어나야 함. 이를 토대로 전체 단어 시퀀스가 나..
데이터 분석 - 1 [EDA(탐색적 데이터 분석)] EDA(탐색적 데이터 분석)데이터의 구조를 확인하고 특성을 파악하기 위해 데이터를 시각화하고 요약하는 과정 진행 순서의 차이나 데이터 특성에 따라 과정이 다를 수 있지만 다음의 과정과 같이 진행할 수 있다. 1. 데이터 불러오기import pandas as pddata = pd.read_csv( '/csv파일경로/csv파일이름.csv' ) 위와 같은 과정을 통해 csv파일을 변수에 저장한다. 2. 데이터 구조 확인data.head() # 데이터 상단의 5개 행을 보여준다data.info() # 데이터 변수들이 가지는 각각의 type을 보여준다data.tail() # 데이터 마지막 5개 행을 보여준다data.describe() # 숫자형 데이터에 대한 기본 통계(평균,표준오차,최소값,4분위수 등)data...
NLP - 2 토큰화토큰화 : 문장을 토큰 시퀀스로 나누는 과정토크나이저( tokenizer ) : 토큰화를 수행하는 과정 ( ex)은전한닢(mecab),꼬꼬마(kkma) ) → 토큰화 + 품사 부착( part-of-Speech tagging )까지 수행 - 단어 단위 토큰화 : 단어 / 어절 단위로 토큰화 수행 - 공백으로 분류 : 가장 쉬운 방법. 그러나 어휘 집합(vocabulary)의 크기가 매우 커질 수 있음ex) 갔었어와 갔었는데요 등 표현이 조금만 바뀌어도 모든 경우의 수 포함but 학습된 토크나이저를 사용 시 [갔었]으로 토큰화하여 구성 - 문자 단위 토큰화 : 문자 단위로 토큰화 수행 - 서브워드 단위 토큰화 : 단어와 문자 단위 토큰화의 중간에 있는 형태 - 바이트 페어 인코딩 : 정보 압축하는 알고..
NLP - 1 트랜스퍼 러닝 : 특정 태스크를 학습한 모델을 다른 태스크 수행에 재사용하는 기법 ●업스트림 태스크 : 트랜스퍼 러닝에서 특정 태스크 ( 먼저 수행하는 태스크 ) - 언어 모델 (language model) : 다음 단어 맞히기 ( GPT계열 모델 )ex ) 티끌 모아 + 빈칸 >> 학습 데이터 말뭉치의 빈칸 부분에 태산이라는 구가 많을 시 태산으로 분류 - 마스크 언어 모델(masked language model) : 빈칸 채우기 ( BERT계열 모델 )ex )  티끌 + 빈칸 + 태산 >> 앞뒤 문맥을 보고 빈칸에 적합한 단어를 반복 학습 → 뉴스 , 웹 문서 , 백과사전 등 글만 있으면 다량의 학습 데이터를 싼 값에 만들 수 있음 ●다운스트림 태스크 : 트랜스퍼 러닝에서 다른 태스크 ( 업스크림 태..
Python 공부일지 - 2 collections 모듈파이썬 내장 모듈컨테이너 자료형을 제공하여 기본 자료형을 확장해서 사용가능 1. deque(Double - Ended Queue)양쪽 끝에서 빠르게 추가 및 삭제가 가능한 자료형collections.deque를 사용하여 생성큐와 스택 기능을 동시에 사용해야 할 때 유용마지막 N개의 history를 유지하는 등에 사용 ※ 거의 다 list로도 가능한 작업이나 속도가 중요할 시 deque가 더 유용할 수 있음!2. counter요소의 개수를 셀 때 사용되는 딕셔너리 서브 클래스collections.Counter를 사용하여 생성데이터 빈도 분석에 유용종목별로 합산 등에 사용가능 3. OrderedDict순서를 유지하는 딕셔너리collections.OrderedDict을 사용하여 형성데..
Python 공부일지 - 1 기본 연산자- 산술연산 : + , - , * , / , // , %- 비교연산 : == , != , > , = , - 논리연산 : and , or , not반복문for문1.리스트, 튜플 등 시퀀스 자료형 요소를 순회-> 리스트 안의 내용을 반복해서 실행fruits = ["apple","banana","cherry"]for fruit in fruits:print(fruit) 2.range 함수를 이용-> range 안의 횟수만큼 반복for i in range(5): print(i)while문 - 조건이 참인 동안 반복while count -> break : 반복문 종료 / continue : 현재 반복을 건너뛰고 다음 반복으로 이동함수def간단하게 아래와 같은 형식으로 작성 후 추후 사용할때 함수이름(변수..