AI를 공부하다 보면 결국 한 논문으로 돌아오게 된다.바로 2017년 논문「Attention Is All You Need」.GPT, BERT, Claude, Gemini, ViT…지금 거의 모든 거대 AI 모델의 조상이다.그런데 솔직히 말하면, 처음 읽었을 때는 거의 이해하지 못했다.논문에 수식은 많고,“Self-Attention”, “Multi-Head”, “Encoder-Decoder” 같은 단어는 쏟아지는데정작 머릿속에는 흐릿한 이미지밖에 없었다.이번 글은 내가 그 논문을 이해해 가며 깨졌던 오해들과,조금씩 그림이 연결되던 과정을 정리한 기록이다.처음 내가 가졌던 오해논문을 처음 봤을 때 내 머릿속 그림은 이랬다.“셀프 어텐션이라는 건 디코더만으로 이루어진 구조고,그래서 가볍고 싸게 SOTA를 달성..

전체 글
물음표 연쇄 살인마2026년 AI는 왜 이렇게 빨라졌을까?Transformer 이후 AI의 진화: Attention, Ensemble, Reasoning 그리고 Memory최근 몇 년 사이 AI 성능은 단순히 “조금 좋아진 수준”이 아니라, 체감적으로 완전히 다른 단계에 들어섰다.특히 Claude Sonnet/Opus, GPT-5.x 계열 같은 최신 모델들은 이전 세대와 비교하면:문맥 이해추론 능력코드 작성장기 대화 유지자연스러운 설명모든 부분에서 큰 차이를 보인다.그렇다면 이런 성능 향상은 단순히 “모델 크기 증가”만으로 가능했던 걸까?결론부터 말하면 아니다.2026년 기준 최신 AI는 단순 Transformer 하나가 아니라:AttentionEnsembleMemoryReasoningRetrievalTool Use같은 ..
Spring 공부를 다시 시작하면서 WebFlux라는 단어가 계속 나왔다. 예전엔 MVC만 썼으니까 낯설었다. R2DBC는 더 생소했다. 겸사겸사 Java 자료구조도 요즘 어떻게 쓰이는지 같이 정리했다.Spring WebFlux — 왜 나왔나기존 Spring MVC는 스레드 기반이다. 요청 하나가 들어오면 스레드 하나가 그 요청을 끝까지 처리한다. DB 조회하는 동안 그 스레드는 그냥 기다린다. 동시 요청이 1,000개면 스레드도 1,000개 필요하다. 스레드는 메모리를 먹는다. 한계가 온다.WebFlux는 이벤트 루프 기반이다. 적은 수의 스레드가 수많은 요청을 처리한다. DB에 쿼리를 날리고 결과를 기다리는 동안 그 스레드는 다른 요청을 처리한다. 결과가 오면 이어서 처리한다.Node.js가 싱글 스..
몇 년 전에 Spring으로 프로젝트를 했었다. 그땐 돌아가니까 넘어갔던 것들이 많았다. 지금 다시 보니 제대로 이해하지 않고 그냥 따라 쓴 게 절반이었다. 이 글은 그걸 다시 정리한 기록이다.Spring이 왜 나왔나Java로 웹 서버를 만들 때 원래는 EJB(Enterprise JavaBeans)를 썼다. 무겁고 복잡했다. 설정도 많고, WAS에 종속됐다. 2003년 Rod Johnson이 "이거 너무 복잡하다"면서 Spring Framework를 만들었다.핵심 아이디어는 두 가지였다.IoC (Inversion of Control): 객체를 내가 만들지 않는다. Spring 컨테이너가 만들어서 필요한 곳에 넣어준다. 제어권이 개발자에서 프레임워크로 역전된다.DI (Dependency Injection)..
세션 시작하자마자 컨텍스트가 15% 사라진다. 아직 아무것도 안 했는데. 원인을 찾아보니 자동 로드되는 MD 파일이 너무 많았다. MEMORY.md가 21개 파일, ai-context 폴더, docs 폴더가 뒤섞여 있었고, 같은 내용이 CLAUDE.md / MEMORY.md / Skills / ai-context에 중복으로 존재했다. 구조를 처음부터 다시 짰다.뭐가 문제였나문제는 세 가지였다.첫째, 역할 경계가 없었다. CLAUDE.md에 있어야 할 내용이 MEMORY.md에도 있고, Skills에도 있었다. 어디 가면 뭘 찾을 수 있는지 몰랐다. AI도 몰랐고 나도 몰랐다.둘째, 자동 로드 범위가 너무 컸다. 세션 시작 시 CLAUDE.md가 ai-context 폴더 전체를 읽어오도록 되어 있었다. w..
머신러닝이 보안에 쓰인다는 말은 많이 들었는데, 실제로 어떤 구조가 어디에 쓰이는지는 잘 안 나온다. CNN과 RNN은 각각 잘하는 게 다르고, 네트워크 보안에서 역할도 다르다. 이 글은 그 차이와 실제 적용 방식을 정리한다.먼저 두 구조의 차이CNN(Convolutional Neural Network)은 공간적 패턴을 찾는다. 데이터의 "어떤 부분에 이런 특징이 있다"를 감지하는 데 강하다. 위치 정보가 중요한 데이터에 잘 맞는다.RNN(Recurrent Neural Network)은 순서와 흐름을 기억한다. 이전 상태를 다음 연산에 넘기는 구조라 시계열, 시퀀스 데이터에 강하다. 시간 순서가 의미를 갖는 데이터에 잘 맞는다.네트워크 트래픽은 이 두 성질을 동시에 갖는다. 패킷 하나의 구조(공간적)도 ..
오늘 하루 동안 다섯 개 문제가 연쇄적으로 터졌다. 하나 고치면 다음 문제가 나왔다. 그 과정을 순서대로 기록한다.문제 1: 뉴스가 한 달 전 기사였다Whalyx 메인 페이지에 글로벌 경제 뉴스를 붙이려고 NewsAPI를 썼다. 근데 뉴스가 이상했다. 최신 헤드라인이 4월인데 3월 기사가 올라왔다.알고 보니 NewsAPI 무료 티어는 최근 1개월 이전 기사만 제공한다. 돈을 내야 실시간이다.해결책은 Google News RSS였다. API 키 없이 feedparser로 긁어오면 실시간 헤드라인이 들어온다.import feedparserfeed = feedparser.parse("https://news.google.com/rss/search?q=stock+market&hl=en-US&gl=US&ceid=U..
Claude Code, 제대로 세팅하면 AI가 팀이 된다Claude Code를 처음 쓰는 사람 대부분이 같은 실수를 한다. CLAUDE.md 하나에 모든 걸 때려넣는다. 역할 지침, 코딩 컨벤션, 프로젝트 구조, 금지 사항까지. 처음엔 잘 된다. 근데 쌓이다 보면 어느 순간 331줄이 된다. 매 대화마다 그 331줄이 전부 컨텍스트에 올라간다. 세션이 1시간도 안 돼서 터진다.세팅을 잘못하면 AI가 멍청해진다. 세팅을 잘하면 AI가 팀이 된다. 그 차이를 직접 겪으면서 정리한 내용이다.왜 세팅이 중요한가Claude Code는 매 세션이 독립적이다. 어제 했던 작업, 정해뒀던 규칙, 쌓아온 컨텍스트가 세션이 끊기면 전부 사라진다. 영화 메멘토의 주인공처럼 깨어날 때마다 기억이 없다.그래서 두 가지를 해결해..