전체 글 578

Encoder와 Decoder (Transformer가의 형제들)

안녕하세요! 이번 포스팅은 이전 포스팅에서 예고한대로 Encoder와 Decoder에 대해서 포스팅을 진행해볼까합니다. 이번 포스팅은 이전 포스팅에서의 Attention에 대한 이해가 기본이해가 선행되면 더욱 재밌게 보실 수 있습니다. 앞선 포스팅을 먼저 읽고 오시는 것을 추천드립니다!https://coding-review.tistory.com/626 Attention is All You Need, Transformer의 시작안녕하세요! 이번 포스팅에선 AI 이론 포스팅의 시작점이 되는 포스팅으로써 여태까지 공부했던 AI 이론을 하나의 흐름으로 꿰기위해 꼭 필요한 포스팅입니다. 들어가기 앞서 이 분야를 연구원coding-review.tistory.comhttps://coding-review.tistor..

LLM 모델의 튜닝 방법론 (LoRA, QLoRA, DoRA)

안녕하세요! 이번 포스팅은 조금은 실무적인 내용을 가져왔습니다. 그럼에도 이론이 잔뜩 들어있지만요. 불과 1년전만 하더라도 파인튜닝으로 모델을 튜닝하는게 당연하게 여겨졌다가 어느순간 사라지게 되었습니다. 그 이유가 모델 학습에 필요한 막대한 컴퓨팅 용량과 시간때문이 아닐까 싶은데요. 조금은 비즈니스적인 이유로 많은 사람들이 이제 파인튜닝 대신 LoRA를 많이 사용하는 것 같습니다. 이번 포스팅에선 LoRA와 그 변형인 QLoRA, 그리고 한때 핫했다가 조금은 사그러든 DoRA에 대해서 알아볼까합니다. 그럼 본격적으로 시작해보죠! 파인튜닝우선 튜닝이 어떤 방식으로 이뤄지는지 알아봐야겠죠? 잠깐 복습하고 넘어가겠습니다! Attention 연산은 "헤드"라는 단위로 움직이고 이 헤드는 하나의 Atte..

MLP레이어란? (MoE와 Hybrid 모델, Macaron 모델)

안녕하세요! 이전 포스팅에서는 Attention Layer에 대해서 짚어보면서 어떻게 모델이 맥락을 만들어내는지 알아봤습니다. 이번 포스팅에서는 Attention Layer가 던져준 맥락을 잘 토스해서 출력까지 스무스하게 이어주는 MLP(구 FFN)에 대해서 정리해봤습니다! MLP는 2017년 Transformer 알고리즘의 초기부터 존재했던 근본 개념입니다. 이전 포스팅에서 Transformer라는 회사에 자료조사 팀인 Attention 부서와 분석팀 MLP가 있다고 예시를 들었습니다. MLP는 자료조사가 끝난 뒤 토큰의 분석을 맡고 있고 잔차 연결로 이어지는 이 흐름을 조금 더 구체적으로 풀어보도록 하겠습니다. 본격적으로 포스팅 시작하겠습니다! MLP의 역할MLP는 Multi-Layer Perce..

기획자에겐 그림판을, 개발자에겐 메모장을 쥐어줬다 (MHA, MQA, GQA)

안녕하세요! 조금 자극적인 제목으로 인사드립니다. 저번 포스팅에선 Attention 레이어, 그 중에서도 Q, K, V의 연산 과정 하나에 관한 내용을 포스팅했습니다. 그래서 이전 포스팅을 통해 Q, K, V가 힘을 합쳐 잔차 스트림에 잔차 연결을 통해 의미를 조금씩 붙인다는 것을 알게 되었습니다. 근데 사실 Attention Layer에서 이 작업은 수십개의 작업 중 하나일 뿐입니다. 이번 포스팅에선 여러 Q, K, V가 어떻게 동작하는지 조금 더 넓은 범위에서 알아보도록 하겠습니다. 잔차 연결과 잔차 스트림이전 포스팅에서부터 이번 도입까지 잔차 연결과 잔차 스트림이라는 얘기가 나오는데 이 개념에 대한 정리부터 짚고 넘어가겠습니다. 잔차 연결과 잔차 스트림은 쉽게 이렇게 이해하셔도 무방합니다...

Attention is All You Need, Transformer의 시작

안녕하세요! 이번 포스팅에선 AI 이론 포스팅의 시작점이 되는 포스팅으로써 여태까지 공부했던 AI 이론을 하나의 흐름으로 꿰기위해 꼭 필요한 포스팅입니다. 들어가기 앞서 이 분야를 연구원도 아닌 제가 왜 공부하게 되었는지를 짧게 설명하고 넘어가야될 것 같네요. 저는 어릴 때 풍력발전기를 보고도 '쟤는 그 어디에도 전기를 생산할 것 같지않게 생겼는데 어디서 전기를 만들고 있는거야?' 라는 의문이 들만큼 동작원리를 궁금해했습니다. 그 아이는 커서 LLM이 토큰을 어떤 원리로 뱉고있는지가 너무 궁금해서 호기심에 하나 둘씩 공부하기 시작했습니다. 근데 처음 공부할 당시는 진짜 이게 무슨 외계어인가 싶었거든요. 저는 백엔드만 공부했었고 웹백엔드랑은 전혀 다른 길이었어서 하나도 모르겠더라구요. 그럼에도 천천..

Attention 레이어 해부하기 (QK회로, OV회로)

안녕하세요! 오랜만에 여유가 생겨서 포스팅을 쓸 시간이 생겼네요. 이번 포스팅에서는 그동안 미뤘던 수학 얘기를 좀 할까합니다. 저는 포스팅을 최대한 쉽게 쓰려고하는 편인데 그래도 앞으로 AI 이론 포스팅을 수월하게 작성하기 위해서는 반드시 한번 짚고 넘어가야한다고 생각해서 아쉽지만 이번 포스팅에는 수식이 잔뜩 나올 예정입니다... 이번 포스팅은 이렇게 이루어져있습니다. 1) Attention 수식의 전체적인 모습2) 행렬의 계산방법3) QK회로와 K의 전치 이유4) 루트 dk로 나누는 이유5) Softmax의 존재의의와 필요성6) OV회로와 잔차 연결 자 이제 본격적으로 시작하도록 하겠습니다! Attention 수식의 전체적인 모습우선 Attention 수식의 전체적인 모습에 대해서 짚고 넘어가겠습니다..

갑자기 어느날 모두가 AI 발전을 늦춰야한다고 이야기하기 시작했다

안녕하세요! 오랜만에 블로그 포스팅을 작성하네요. 요즘 업무에 치이느라 조금 뜸해졌는데 오랜만에 포스팅을 적습니다. 요즘 큰 이슈 중에 하나인 AI 프론티어 회사들이 다같이 입을 모아 AI 발전을 늦춰야한다고 얘기한 사건 다들 뉴스로, 유튜브로, 트위터로 많이 접하셨을겁니다. 원래 저는 포스팅을 하면서도 이슈에 대해서 다룬적은 한번도 없는데 제 블로그 포스팅 방향과 다르기도 했지만 이슈로 잡기에는 대단찮은 것들이 많았고 제 나름대로 생각해보고 넘어갈 수 있는 것들이었기 때문에 굳이 적지 않았습니다. 그럼에도 이번 이슈에 대해서 언급하고싶었던 이유는 이건 진정으로 모두가 생각해봐야하는 문제가 아닐까해서 그리고 이때 당시의 내 생각을 글로 남기고 근시일내인 2~3년 뒤에 미래에 살고있는 제가 이 글을 보..

기타/회고 2026.09.15

우린 전사 직원이 AI 다 써야돼요. (GPU 서버 한대를 쥐어주며..)

안녕하세요! 오랜만에 블로그 포스팅으로 써보고싶은 주제가 생각나서 컴퓨터 앞에 앉았습니다. 이번 주제는 실제로 있을법한 일을 재구성해서 엔지니어링적으로 문제를 해결하는 과정을 써볼까합니다. 요즘 엉덩이 무거운 금융권도 AI를 도입하려고 여기저기서 난리다보니 국내기준 모든 개발자 수요가 줄었지만 AI엔지니어는 수요가 폭발하고 있는 상황입니다. 하지만 저는 AI엔지니어링.. 그 끝은 백엔드와 닿아있다는걸 깨닫게 되는건 그리 오래걸리지 않았습니다. 상황은 이렇습니다. 고객이 AI를 도입하는데 그래픽카드 서버를 한대만 주겠다고 하는 상황이죠. 이때 우리가 할 수 있는 다양한 해결책을 생각해봅시다. sLLM을 올리는건 문제가 안됩니다만 문제는 사용자마다 들어나는 KV Cache이죠. 보통 나쁘지않은 질답이..

Attention 레이어와 MLP 레이어

안녕하세요! 이번 포스팅에서는 MLP레이어에 대해서 공부한 내용을 정리해보려고합니다. LLM에서 MLP레이어는 핵심축 중에서도 핵심축인데요. 이제 천천히 이 레이어에 대해서 알아보며 끝으로 갔을 때는 MLP레이어의 진수에 대해서 맛보게 될 것입니다. 레이어들Attention 레이어, MLP 레이어LLM에는 크게 두 개의 레이어가 있다고 표현합니다. Attention 레이어와 MLP 레이어 이렇게 두 개인데요. Attention 레이어는 기본적으로 Attention 연산을 수행하는 레이어로서 단어와 단어 사이의 맥락을 파악하는 용도로써 사용됩니다. 그에 비해 MLP 레이어는 맥락이 파악된 토큰을 입력받아서 그 토큰이 가진 정보에 '데이터'를 입힙니다. 예를 들어서 "프랑스의 수도는?"이라는 맥락이 완성..

Redis는 싱글스레드인데 어떻게 초당 수십만건의 요청을 처리할까? (feat. epoll)

안녕하세요! 이번 포스팅은 Redis에 대한 포스팅으로 찾아뵙게 되었습니다. Redis는 업계 표준이라고 해도 될 정도로 많은 기업, 많은 프로젝트에서 사용되고 있는데요. 아무래도 캐싱, 메세지 큐, 실시간 데이터 처리 등 다양한 방면으로 사용되고 HA 방법론도 여러가지 제공해주고 커뮤니티도 많이 형성되어있어서 인기가 좋은 것 같습니다. 흔히 Redis와 Memcached의 차이를 면접 때 물어보면 이런 대답이 100퍼센트 나옵니다. "Redis는 싱글 스레드이고 Memcached는 멀티 스레드여서 Redis가 성능상 이점이 있습니다." 그럼 면접관이 다시 "싱글 스레드는 처리량이 안좋은거 아닌가요?" 저도 신입 때 이 둘의 차이에 대해서 공부했지만 한번도 이런 생각까지 사고가 확장되진 않았던 것 ..