[혁펜하임의 Easy! 딥러닝] 책 리뷰
·
🥐 Data Study/ML-DL
평소에 전공관련 서적이 나오면 도서관에서라도 꼭 찾아보는 편인데, 이번에 내가 관심있게 강의를 찾아 봐오던 강사님이 딥러닝 책을 내셨다!석사학위논문을 쓸 때 혁펜하임님의 강의 TTT를 들으며 트랜스포머 개념을 다잡았던 기억이 새록새록... 석사 학위를 위해 딥러닝을 공부해 가면서 내가 제일 막막했던 것은 너무 딱딱하게 느껴지던 교과서적인 개념들, 용어도 어렵고 머리 깨지게 몇 번을 읽어도 이해되지 않았던 수식들... 그리고 결국엔 빡빡한 논문을 찾아보고 스스로 정리해야 했던 내용들 ㅠㅠ 졸업과 동시에 급격하게 까먹고 있는 이론들을 제대로 복습할 겸 혁펜하임 강사님의 딥러닝 책을 찾게 되었다.이 책은 제목에서부터 알 수 있듯이 딥러닝의 구조와 작동방식을 다루고 있다. 이 책에서는 인공신경망의 기본 개념들부..
비전 트랜스포머(Vision Transformer, ViT)
·
🥐 Data Study/ML-DL
비전 트랜스포머(Vision Transformer, ViT)는 자연어처리 분야에서 표준으로 자리 잡은 트랜스포머 모델을 이미지 처리에 적용한 모델이다. 합성곱 모델은 이미지를 분류하기 위해 지역 특징을 추출하는 반면, ViT는 셀프 어텐션을 사용해 전체 이미지를 한 번에 처리한다. 입력 이미지가 격자로 작은 단위의 이미지 패치로 나뉘어 순차적으로 입력되는 방식이다.  ViT 모델은 다음 (1)의 그림과 같이 입력 이미지를 트랜스포머 구조에 맞게 일정한 크기의 패치로 나눈 다음, 각 패치를 벡터 형태로 변환하는 패치 임베딩(Patch Embedding)과 (2)의 그림과 같이 각 패치와의 관계를 학습하는 인코더 계층으로 구성된다.  (1) Patch Embedding   패치 임베딩은 이미지를 작은 패치(..
트랜스포머(Transformer)
·
🥐 Data Study/ML-DL
트랜스포머(Transformer)는 주로 자연어 처리 작업에 사용되는 딥러닝 모델로 RNN이나 LSTM과 같은 순환 신경망을 사용하지 않고, 입력 시퀀스의 중요한 부분에 초점을 맞춰 문맥을 파악하는 데 사용되는 어텐션 메커니즘에 완전히 의존한다. 이로 인해 긴 시퀀스도 효율적으로 처리할 수 있으며 병렬 처리가 가능하여 학습 속도가 빠르다.  트랜스포머 모델은 인코더(Encoder)와 디코더(Decoder)의 두 주요 구성요소로 나뉜다. 이들은 각각 N개의 트랜스포머 블록(Transformer Block)으로 구성된다. 이 블록은 멀티 헤드 어텐션(Multi-Head Attention)과 순방향 신경망(Feed-Forward Network)으로 이루어져 있다. 이러한 구성요소를 통해 입력 시퀀스의 복잡한 ..
어텐션 메커니즘(Attention Mechanism)
·
🥐 Data Study/ML-DL
어텐션 메커니즘(Attention Mechanism)은 주로 시퀀스 데이터 처리에 사용되는 기술로 seq2seq(Sequence-to-sequence) 모델의 성능을 향상시키기 위해 도입된 기법이다.    seq2seq 모델은 위 그림의 예시와 같이 인코더(Encoder)와 디코더(Decoder)로 구성된 신경망 구조로, 입력 시퀀스를 인코더를 통해 고정된 길이의 벡터로 인코딩하여 문맥 벡터(Context Vector)를 생성하고, 디코더가 이를 다시 시퀀스로 변환하여 출력하는 딥러닝 모델이다. seq2seq는 기계번역 같은 많은 자연어처리 문제에서 유용하지만, 고정된 길이에 전체 입력 시퀀스를 압축하기 때문에 정보 손실이 발생한다. 또한 기울기 소실 문제가 발생하여 훈련이 불안정해진다. 이러한 seq2..
합성곱 신경망 기반 이미지 분류 모델 : ResNet, EfficientNet
·
🥐 Data Study/ML-DL
합성곱 신경망 기반 이미지 분류 모델  합성곱 신경망(Convolutional Neural Network, CNN)은 주로 이미지 인식과 같은 컴퓨터비전 분야의 데이터를 분석하기 위해 사용되는 인공 신경망의 한 종류이다.    합성곱 신경망은 입력 데이터의 지역적인 특징을 추출하는 데 특화된 구조를 갖고 있으며 이를 위해 합성곱(Convolution) 연산을 사용한다. 합성곱 연산은 이미지의 특정 영역에서 입력 값의 분포 또는 변화량을 계산해 출력 노드를 생성한다. 특정 영역 안에서 연산을 수행하므로 지역 특징(Local Features)을 효과적으로 추출할 수 있다. [그림 2-1]과 같이 Convolution 층이 입력 이미지에서 작은 영역을 스캔하여 중요한 특징을 추출한다. 그 다음 Max-Pool..
시계열 분석(Time series data)
·
🥐 Data Study
📚 참고URL Forecasting: Principles and Practice (https://otexts.com/fppkr/) Forecasting: Principles and Practice 2nd edition otexts.com 1. 시계열 데이터(Time series data) - 시계열 데이터란 시간 간격을 두고 있는 일련의 데이터셋의 집합이다. 이 데이터를 그래프로 표현하면 일반적으로 x축은 시간이 된다. - 시계열 데이터의 분석 목적은 시계열이 갖고 있는 법칙성을 발견해 이를 모형화하고, 또 추정된 모형을 통하여 미래의 값을 forecasting(예측)하는 것이다. - 시계열 데이터란 시간을 통해 순차적으로 발생한 관측치의 집합으로, 이렇게 발생한 연속적인 관측치들은 서로 관련이 있다. ..
[패스트캠퍼스] 데이터시각화 강의 학습일지
·
🥪 Education/2023모두를위한딥러닝(Fastcampus)
1. 강의 학습 계기 - 우연찮게 유튜브에서 데이터 시각화 공모전에 대한 내용을 보게 되었고, 대상을 수상한 팀이 Tableau를 이용해 대쉬보드를 만든 것을 보고 나도 한 번 만들어봐야지 하는 생각을 가지고 있었다. - 데이터 시각화라면 파이썬에서 matplotlib, seaborn, plotly 라이브러리를 사용하는 것에 익숙한데, GUI환경에서 손쉽게 시각화를 할 수 있다는 점이 매력적인 것 같았다. 많은 양의 데이터에서도 빠르게 인터랙티브하게 시각화가 가능한지 궁금했고, 이를 구현해보고 싶었다. - 대학원생이라 Tableau를 학생 계정으로 이용할 수 있어서 일단 다운받아서 켜 봤다. 메뉴 하나하나 건드려가며 배울 수 있을 것 같았는데 그러기엔 시간이 너무 오래 걸려서 책을 하나 잡고 정독하거나,..
[대회] 2023 헬스케어경진대회 참여후기(제출X)
·
🍞 Data Project/경진대회
1. Competition - 구강 이미지 합성 데이터를 활용한 충치 치아를 분류하는 AI 모델 개발 https://github.com/bab-korea/healthcare-ai-contest ※ 평가지표 Image classification data로 f1-score가 가장 높은 팀 선정 2. Details 1. CMD로 Bastion Host 및 GPU Server 접속 Bastion Host에 접속하려면 Putty, CMD, mobaXterm 등 접속도구를 사용해야 하는데 나는 윈도우 환경이라 무난하게 CMD로 했다. 1) 설정 > 선택적 기능 >OpenSSH 클라이언트 설치 2) ssh 접속 명령어 ssh[유저ID]@[Bastion Public IP] 3) GPU Server 접속 - 별도 공유된..
[자연어처리] 8. Sequence labeling and HMM part 3
·
🥪 Education/2021석사과정
Phrase Chunking : Partial Parsing 청킹 : 문장 안에 있는 의미있는 청크 (명사구, 동사구) 어떤 것은 한단어, 어떤 것은 여러단어로 이루어진 프레이즈도 있다. non-recursive 라는 것은 VP를 크게 보지 말자라는 것이다. 딱 [ ] 안의 것들만 VP, NP로 보자는 것이다. (문장의 단어들 사이에 의미있는 괄호 넣기라고 보면 된다.) 개체명 인식기도 phrase chunking이다. Phrase Chunking as Sequence Labeling sequential labeling 문제로 보는 것이다. 시퀀셜 입력이 들어왔을 때, 거기에 레이블을 달아주는 것이다. 일종의 형태소 분석기라고 생각하자. 형태소 분석기도 각 단어마다 품사라는 레이블을 달아주는 거니까. s..
[자연어처리] 7. Sequence labeling and HMM part 2
·
🥪 Education/2021석사과정
Sequence labeling and HMM part 2 HMM의 세 가지 기본 문제 1960년대 IDA의 잭 퍼거슨 문제 1 : (평가) 주어진 관찰 순서. observation 시퀀스(input 시퀀스)가 나타났을 때 주어진 HMM모델 람다=A,B (A : transition probability matrix, B : observation probability matrix) 하에서 이러한 (O=O1O2…OT)인풋 시퀀스가 나타날 확률 ⇒ 확률 값이 낮으면 잘못된 시퀀스이다. 결국 이 시퀀스가 맞느냐 안맞느냐는 확률 값으로 판단이 가능할 것. 만약 이 문제가 음성인식이라면, 인식해 낸 시퀀스가 여러 개 있을 때 시퀀스 확률 값이 높은 것을 선택하는 것이 맞겠죠. 더 그럴듯한 시퀀스니까 음성인식의 경우..
[자연어처리] 6. Sequence labeling and HMM part 1
·
🥪 Education/2021석사과정
Sequence labeling and HMM part 1 ! 들어가기 전에 : 시퀀스 라벨링 작업을 해봅시다! 품사태깅을 해봐서 알지만, 모호성이 굉장히 많다. 한 개의 단어가 여러개 품사로 태깅되는 경우가 많다. 어떻게 가장 가능성이 높은 태깅을 할 수 있을까하는 것이 하고자 하는 것이다! 품사(POS) 태깅 : 가장 낮은 수준의 구문 분석. 형태소 분석의 결과가 여러 개인 경우 가장 그럴듯한 하나의 결과를 찾아내는 작업 세종 Corpus : 총 46개의 tags 영어 POS Tagsets 브라운 코퍼스 (1962) 100만 단어 짜리 오늘날 NLP에서 가장 일반적인 것은 45개의 태그(표준이라고 생각하면 됨)로 구성된 Penn Treebank 세트이다. C5 tagset : 영국에서 만든 61개 태..
[자연어처리] 5. N-gram part2
·
🥪 Education/2021석사과정
N-gram part2 언어모델링 랭귀지 모델 : 한 문장이 나올 확률. 문장확률 : P(W) 그 언어에 맞는 문장이 나올 확률. 한 문장에 n개의 단어로 이루어진 문장으로 본다. → 네 개의 단어가 나온 다음에 다섯번째로 이 단어가 나올 확률 랭귀지 모델은 The Grammar와 같은 용어지만, 언어모델, LM이 더 표준적인 용어이다. chain rule the big red dog was의 확률을 구하자면 : = the가 나타날 확률 * the가 나타났을 때 big이 나타날 확률 * the big이 나타났을 때 red가 나타날 확률 * the big red가 나타났을 때 dog가 나타날 확률 * the big red dog가 나타났을 때 was가 나타날 확률 랭귀지 모델 구하기 : its water ..