인기 글
-
[2024년 상반기 IBK기업은행 신입행원 채용][디지털] 필기시험 합격 후기
2024년 상반기 IBK기업은행 신입행원 채용 디지털 직무로 지원했습니다!필기 시험 합격 후기를 간단히 적어볼까 합니다!시험 개요시간 : 120분문제 수 : 75문제 (1문제당 약 1분 30초만에 풀어야함)문제 구성- 직업기초 40문제 (1.5점)- 직무수행 객관식 30문제 (1점)- 직무수행 주관식 5문제 (2점) 우선, 지금까지는 디지털이라는 이름으로 IT와 디지털을 함께 뽑았다면, 이번 공채부터 디지털과 IT를 분리해서 채용하게 되었습니다. 그에 따라 필기, 실기 시험에 차이가 생겼습니다. 이 점을 잘 인지하고 필기와 실기를 준비해야할 것 같습니다. 새로운 디지털 분야는 필기시험 직무수행 영역에서 데이터베이스, 데이터분석, 인공지능 모델링, 블록체인, 시사 주로 총 5과목이 주로 출제됨을 알 수 ..
2024.06.15
-
트랜스포머(Transformer) - 입력(포지셔널인코딩)
https://arxiv.org/abs/1706.03762 Attention Is All You Need The dominant sequence transduction models are based on complex recurrent or convolutional neural networks in an encoder-decoder configuration. The best performing models also connect the encoder and decoder through an attention mechanism. We propose a new arxiv.org 트랜스포머란? - 인코더-디코더 구조를 따르면서, RNN을 사용하지 않고 어텐션으로만 구현한 모델 인코더-디코더 구조 - 인코더 :..
2023.07.15
-
SVR(Support Vector Regression)
서포트 벡터 머신 회귀(support vector machine regression) - 비모수적 방법 - 커널 함수를 기반으로 함 - 제한된 마진 오류 안에서 가능한 한 많은 관측치가 마진에 포함되도록 학습하는 방법 - 마진 안에 관측치가 많은 초평면이 좋은 초평면이다 - svm과 마진을 고려하는 건 똑같지만, svr은 마진 밖에 있는 error가 최소가 되도록 동작함 - 마진의 폭은 하이퍼파라미터 ε(입실론)으로 조절(slack variable 과 혼동 x) - 마진을 통해 오차에 반응하지 않는 영역 마련 -> 노이즈에 영향을 받지 않도록 - 마진에 들어가는 학습데이터를 추가 -> 예측 능력에 영향 X - 모델은 입실론에 민감하지 않다 - 입실론이 아니라 규제 C에 민감하다 - SVR의 규제 C - ..
2023.04.01
-
[데이터 분석을 위한 SQL 레시피] 15강 - 사이트 내의 사용자 행동 파악하기
웹사이트에서의 특징적인 지표 - 방문자 수 - 방문 횟수 - 직귀율 - 이탈률 1. 입구 페이지와 출구 페이지 파악하기 입구 페이지 - 사이트 방문했을 때 처음 접근한 페이지(랜딩 페이지) 출구 페이지 - 마지막으로 접근한 페이지(이탈 페이지) 코드 15-1 - FIRST_VALUE, LAST_VALUE : 첫번째 값을 가져오기 ex) FIRST_VALUE(path) : path열의 첫번째 값으로 landing 열을 구성 - partition by - rows between unbounded preceding(처음), following(끝) 코드 15-2 입구,출구 페이지의 방문횟수 집계 어떤 페이지에서 조회하기 시작해서 어디서 이탈하는지도 파악해야됨! 코드 15-3 세션별로 입구 페이지와 출구 페이지의..
2023.11.06
-
단어 표현 방법 - 시소러스, 통계 기반 기법
자연어란? - 한국어, 영어 등 우리가 평소에 쓰는 말 자연어처리(Natural Language Processing, NLP)란? - 자연어를 처리하는 분야 - 우리의 말을 컴퓨에게 이해시키기 위한 기술(분야) 단어는 의미의 최소 단위라고 할 수 있음 자연어를 컴퓨터에게 이해시킬 때 '단어의 의미'를 이해시키는 게 중요! 즉, 단어의 의미를 잘 파악할 수 있는 표현 방법에 대해 고민해봐야 한다 딥러닝 이전의 고전적인 방법들은 크게 3가지가 있다. 1. 시소러스를 활용한 기법 2. 통계 기반 기법 3. 추론 기반 기법(ex. word2vec) 시소러스 - 시소러스 형태의 사전을 초창기에는 이용했음 - 동의어 그룹, 유의어 그룹 - 상위와 하위, 전체와 부분 등 세세한 관계를 그래프 구조로 정의 - NLP ..
2023.09.16
-
트랜스포머(Transformer) - 인코더, 디코더
이 글을 통해 트랜스포머의 인코더와 디코더에서 각각 어떤 일이 일어나는지, 뭐가 사용되는지를 총 정리해보고자 한다 인코더의 구조 - num_layers : 트랜스포머의 하이퍼 파리미터. 지정한 개수의 인코더층을 쌓음. 트랜스포머의 인코더는 크게 2개의 sublayer로 나눠짐 1. 멀티헤드어텐션층 2. 포지션-와이즈 피드포워드 신경망 층 자세하게는 다음과 같이 나뉨! 1. 임베딩 벡터에 포지셔널 인코딩을 수행 -> 단어의 위치 정보 반영 2. 셀프 어텐션 층을 지남 - 멀티 헤드 셀프 어텐션 3. 잔차 연결과 층 정규화 4. 피드포워드 신경망 층을 지남 5. 잔차 연결과 층 정규화 - 포지션 와이즈 피드포워드 신경망, 일반적으로 알고있는 피드 포워드 신경망 인코더의 멀티 헤드 셀프 어텐션 어텐션 개념 복..
2023.07.19
-
[데이터 분석을 위한 SQL 레시피] 19강 - 데이터 중복 검출하기
RDB는 적절하게 유니크 키를 설정한다면, 키가 중복되었을 때 자동으로 오류가 발생하여 데이터 무결성이 보장됨 하지만 RDB가 아닌 데이터베이스(Hive, BigQuery)에서는 중복을 사전에 확인하는 기능이 없음 데이터가 많으면 중복을 눈으로 하나하나 확인하는 건 불가능하기 때문에, 중복 데이터 확인 및 제외 방법을 알아야함 1. 마스터 데이터의 중복 검출하기 - 마스터 데이터에 중복이 존재한다면? : 마스터 데이터를 로그 데이터와 결합할 때 로그가 여러 레코드로 카운팅 되어 결과가 이상해짐 몇가지 이유 - 데이터 로드할 때 여러번 로드한 경우 - 마스터 데이터를 갱신할 때, 오래된 데이터와 새로운 데이터가 서로 다른 레코드로 분리된 경우 - 운용상의 실수로 같은 ID를 다른 데이터에 재사용한 경우 -..
2023.11.20