| 일 | 월 | 화 | 수 | 목 | 금 | 토 |
|---|---|---|---|---|---|---|
| 1 | 2 | 3 | 4 | 5 | ||
| 6 | 7 | 8 | 9 | 10 | 11 | 12 |
| 13 | 14 | 15 | 16 | 17 | 18 | 19 |
| 20 | 21 | 22 | 23 | 24 | 25 | 26 |
| 27 | 28 | 29 | 30 |
- OoD
- ASGI
- ML
- ood detection
- pytorch
- full space
- Variance
- Trouble shooting
- Diffusion
- seq2seq
- 기초개념
- 논문 리뷰
- AI agent
- dl
- AI
- TRANSFORMER
- MLOps
- wsgi
- nvidia-smi
- fastapi
- LLM
- error
- LSTM
- BentoML
- rnn
- paper review
- GAN
- Bias
- VAE
- outofdistribution
- Today
- Total
목록전체 글 (13)
머신러닝이 머신데
LLM의 역사를 공부하면서 일단 기초는 다시 복기하고 가야할 것 같다. 과거에 텍스트 데이터를 처리할 때는 Recurrent Neural Network, 순환 신경망을 사용한다.자연어 처리에서는 순서 sequence와 문맥 context가 중요한 데이터였기 때문에 RNN이나 LSTM이 사용되었다. 맥락을 이해하기 위해서는 과거의 시제도 필요하기 때문에 과거의 데이터와 현재 데이터를 반영하여 학습하는데, 과거의 데이터를 계속해서 반영하다 보면, 초기 정보는 점점 희석되게 되어, 제대로 담을 수 없게 된다. 이게 바로 long term dependency 이슈이다.이걸 보완하기에 나온 것이 Long Short-Term Memory이다. LSTM은 gate 구조를 통해 중요한 정보는 기억하고 불필요한 정보는 ..
ABSTRACTDNN은 large한 labeled dataset에서는 잘 동작하지만, 가변 길이의 sequence를 직접 mapping하는 구조가 없었음. 그래서 해당 논문에서는 sequence 구조에 대해 end to end sequence learning 방식을 제안하였음.multi-layer LSTM을 사용해 input sentence를 고정된 차원의 vector로 변환하고 다른 deep LSTM을 사용해 vector로부터 target sentence를 decode함.input -> Multi-layer LSTM -> vector -> deep LSTM(decode) -> output그 결과, 번역 태스크인 English -> French에서 전체 test set 기준 BLEU score 34.8로..
그놈의 LLM, 온 세상이 LLM이다. 나 역시 GPT, Claude, Gemini 잘 쓰고 있다. 근데 나는 Vision, Generation 쪽을 많이 해와서 LLM 트렌드를 계속 쫓아고 깊이 파보지는 않았다. AI 엔지니어가 되가지고 LLM에 대해 모르고 쓰면 안될 것 같다. 어떤 히스토리가 있고, 어떤 문제를 해결해왔는지를 알아야 이 분야를 파악하기 쉬운 것 같다. 그래서, 이 뿌리는 어디서 시작했는지, 어떻게 뻗어나가고 있는지를 알아보려 한다. 대표되는 논문을 추려서 읽어보고 리뷰하려 한다. 나와 같이 슬금슬금 알아가고 싶은 사람들에게 아래 흐름을 따라가보길 추천한다. 나도 흐름을 따라가길 추천한다.. (할 수 있겠지...?)대표적인 흐름은 이 정도인 것 같다.일단 써먹는 건 다들 잘하니까, 더..
🧩 문제 상황Ray를 실행 중 다음과 같은 에러가 반복 발생함.WARNING worker.py:1091 -- The object store is using more than 95% of available memory.→ Ray가 사용하는 shared memory 공간이 가득 차서 object를 더 이상 저장할 수 없는 상황🧠 원인Ray는 내부적으로 object store라는 메모리 영역을 사용해 데이터를 관리함.특히 ray.put(), ray.get(), remote 함수 실행 등에서 데이터를 캐싱하면서 object store에 메모리가 쌓임.❗ 하지만 데이터를 사용한 뒤 명시적으로 지우지 않으면 메모리가 해제되지 않고 누적돼서 일정 수준 이상 차면 해당 경고 메시지가 뜸. ✅ 해결 방법 1불필요한..
❗ 문제 상황로컬에서 커밋까지 완료했는데 git push가 계속 실패했다.❓ 원인커밋 기록에 용량이 너무 큰 파일이 포함되어 있었기 때문. -> 나는 이때 아마 깜빡하고 모델 pth 파일을 올리려했던 것 같다 (데헷🤫)해당 파일을 지우고 다시 커밋했지만, 여전히 push가 안 됨.이유는?👉 파일을 지웠더라도 커밋 히스토리에 기록이 남아 있기 때문에!✅ 해결 방법 1문제가 되는 파일이 어느 커밋에 있는지 확인아래 명령어로 해당 커밋에서 파일 제거git rm --cached path/to/large_filegit commit --amend✅ 해결 방법 2위의 방식 아니면, 아예 커밋 기록을 다시 돌아가서 리셋하는 방법도 있다. 그리고 다시 커밋 후 푸시해도 됨!지워야 할 파일이 너무 많으면 아예 커밋..
요즘 면접을 다니다 보니 공통된 질문을 가끔 받게 된다. 그런데 가장 기억나는 것이 AI agent에 대한 질문이었다. AI agent에 대해 아시나요?안다고 샬라샬라 얘기했지만... 사실... 저도 제대로 모르는데요. AI 모아놓은 것.. 아닌가요...? 팔란티어(👍) 투자하면서 미국 정부에서 팔란티어의 AI agent로 공무원들이 사용할 수 있는 정부 시스템을 만든다 어쩌구 하는 것을 봤던 기억이 있는데 그 부분을 어찌저찌 해석해서 말했었다... 근데 정확한 답변이 아니었고...AI 공부한다는 사람이 이런 것도 모르면 진짜 신뢰도 떨어져 보인다. 요즘 연구에만 집중하느라 다른 최신 논문은 못 본 것이 아차 싶었다. 트렌드를 따라가고 IT 기사도 많이 읽어야 하는데 말이다. 분명 찾아봤는데 왜 모르겠..
필수 개념1. 신경망의 개념 및 학습 원리2. CNN이란?3. RNN이란?4. Transformer란?5. Generative Models란?1. 신경망의 개념과 학습 원리는?더보기신경망의 기본 개념뉴런 : 여기서 말하는 뉴런은 생물학적인 뉴런을 수학적으로 모델링한 것인데, 실제 뉴런이 입력 값을 받아 세포체에 저장하다가 자신의 용량이 넘어서면 외부로 출력값을 보내는 것처럼, 인공신경망 뉴런도 여러 입력값을 받아 일정 수준이 넘으면 활성화되어 출력값을 내보낸다. 가중치: 활성화 함수(Activate Function): 위 뉴런 설명에서 입력값의 총합을 활성화하여 출력값을 내보낼 때 이 함수를 통해 계산된 값을 출력하게 된다. 이러한 활성화 함수는 신경망이 비선형 문제를 해결할 수 있게 하며, 복잡한 패턴..
필수 개념머신러닝과 딥러닝이란?지도학습, 비지도학습, 강화학습이란?편향-분산 트레이드오프 (Bias-Variance Tradeoff)과적합(Overfitting)과 과소적합(Underfitting) 해결 방법특성 선택(Feature Selection) 및 차원 축소 (PCA, t-SNE)데이터 전처리 (정규화, 표준화, 결측값 처리) 1. 머신러닝과 딥러닝이란?더보기머신러닝은 주어진 데이터에서 패턴을 학습하여 예측하는 모델을 만드는 방법. 특징(Feature)을 사람이 직접 설계하는 경우가 많고, 전통적인 알고리즘(예: 선형 회귀, 랜덤 포레스트, SVM 등)을 사용함. 딥러닝은 신경망(Neural Network)을 기반으로 데이터를 입력하면, 모델이 자동으로 중요한 특징(Feature)을 추출하고 학습..
ML 기초 개념에 대해 설명해봐! 하면 사실 아직 제대로 말을 못한다. 더 제대로 체화해서 똑똑하게 말할 수 있는 연습을 하기 위해 다시 복습해보려 한다.사실 그제 코테를 봤는데 생각지도 못한 주관식 문제가 있었다. 오차역전파 알고리즘에 대해 설명해보라는 것이었는데, 멍청하게도.. 제대로 말을 못하겠어서 보기 좋게 망했다! 풀고 나서 혼자 충격에 빠지고... 아 이건 안되겠다.. 싶었다. 나같은 사람 거르기 딱 좋은 문제였던 것 같다. 가고 싶은 회사였는데 아쉬웠다.. 준비된 자에게 기회가 온다고 하는데 잘 걷어차고 나니 내실을 잘 쌓아야 겠다라는 생각이 들었다. 열심히 해보자!커리큘럼은 아래와 같고, GPT한테 짜달라고 했다. AI/ML/DL + Computer Vision 학습 커리큘럼 (심화 개념 ..
모델 학습을 위해 GPU를 사용할 때나 초기 셋팅을 할 때 가끔 이런 에러가 뜰 때가 있다.RuntimeError: The NVIDIA driver on your system is too old (found version 11060). Please update your GPU driver by downloading and installing a new version from the URL: http://www.nvidia.com/Download/index.aspx Alternatively, go to: https://pytorch.org to install a PyTorch version that has been compiled with your version of the CUDA driver.-----..