본문 바로가기
300x250

전체 글61

TurboQuant: 고차원 회전을 이용한 KV 캐시 양자화 및 PyTorch 실전 구현 TurboQuant: 고차원 회전을 이용한 KV 캐시 양자화 및 PyTorch 실전 구현대규모 언어 모델(LLM) 추론 시 컨텍스트 길이가 길어짐에 따라 KV 캐시(Key-Value Cache)가 점유하는 VRAM 용량은 기하급수적으로 증가합니다. 이는 긴 문맥을 처리해야 하는 서비스에서 가장 큰 비용 병목 구간이 됩니다.2026년 ICLR에서 발표된 TurboQuant는 고차원 벡터의 수학적 특성을 활용하여 별도의 데이터 학습(Calibration) 없이도 KV 캐시를 3~4비트 수준으로 압축하는 혁신적인 방법론을 제시했습니다. 본 포스팅에서는 turboquant-pytorch 구현체를 바탕으로 그 작동 원리와 실전 사용법을 분석합니다.TurboQuant의 핵심 작동 원리TurboQuant의 차별점은 .. 2026. 3. 31.
pplx-embed 확산 기반 사전학습을 통한 고성능 다국어 임베딩 시스템 구축 pplx-embed: 확산 기반 사전학습을 통한 고성능 다국어 임베딩 시스템 구축pplx-embed는 Perplexity에서 공개한 실제 웹 규모 검색 작업에 최적화된 다국어 임베딩(Embedding) 모델 컬렉션입니다. Qwen3를 백본(Backbone)으로 하며, 확산 기반 사전학습과 양방향 주의(Bidirectional Attention) 메커니즘을 결합하여 기존 단방향 LLM 기반 임베딩 모델의 한계를 극복했습니다.개념 및 배경기존의 인스트럭션 튜닝(Instruction Tuning) 기반 임베딩 모델은 사용자가 입력하는 프롬프트 접두사(Prefix)에 따라 임베딩 공간이 가변적이라는 취약점이 있습니다. 또한, 대부분의 고성능 LLM이 채택하고 있는 인과적(Causal) 디코더 구조는 텍스트 전체.. 2026. 2. 27.
Pieces OS: Claude Desktop과 연동하여 개발 워크플로우 기억 시스템 구축하기 Pieces OS 개요Pieces OS는 개발자의 작업 흐름을 OS 레벨에서 자동으로 캡처하고 저장하는 시스템입니다. 일반적인 AI 어시스턴트가 대화 세션이 종료되면 컨텍스트를 잃어버리는 것과 달리, Pieces OS는 최대 9개월간 작업 히스토리를 로컬에 보관합니다.기본적인 동작 방식은 다음과 같습니다. IDE에서 작성한 코드, 브라우저에서 참고한 문서, 복사한 스니펫, 팀과의 대화 등 개발 과정에서 발생하는 모든 활동을 백그라운드에서 수집합니다. 수집된 데이터는 전부 로컬 디바이스에 저장되며, 외부로 전송되지 않습니다.LTM-2.7 엔진의 작동 원리Long-Term Memory 엔진은 Pieces OS의 핵심 구성요소입니다. 이 엔진이 수행하는 주요 작업은 세 가지로 요약됩니다.첫째, 20분 간격으로.. 2026. 2. 14.
LLM 입력 최적화 및 비용 절감을 위한 경량화 라이브러리 Prompt Refiner 상용 LLM 애플리케이션, 특히 RAG(검색 증강 생성) 시스템을 운영함에 있어 API 비용 효율화와 컨텍스트 윈도우(Context Window) 관리는 핵심적인 엔지니어링 과제입니다.본 포스팅에서는 불필요한 토큰을 제거하여 API 비용을 절감하고, 제한된 토큰 예산 내에서 프롬프트를 동적으로 구성할 수 있도록 지원하는 파이썬 라이브러리, prompt-refiner를 분석합니다.1. 개요 및 핵심 가치https://github.com/JacobHuang91/prompt-refinerprompt-refiner는 LLM 입력 데이터의 전처리를 자동화하는 경량 라이브러리입니다. 외부 의존성(Dependency)을 최소화하여 설계되었으며, 프로덕션 환경에서의 안정성과 성능 최적화에 초점을 맞추고 있습니다.토큰 .. 2025. 12. 5.
오픈 LLM에서 중국어, 한자 안뜨게 하기 (vLLM Custom Logits Processors) 대규모 언어 모델을 쓰다 보면 특정 단어나 토큰이 나오지 않도록 막거나, 반대로 어떤 표현은 꼭 포함시키고 싶을 때가 있습니다. vLLM의 '커스텀 로짓 프로세서’입니다. 모델이 다음 토큰을 선택하기 직전 단계에 개입해서 로짓 값을 바꿀 수 있게 해주는 장치로, 모델의 동작을 원하는 방향으로 유도하는 데 매우 유용합니다.트랜스포머의 로짓프로세스를 이용해서 예전에도 혼자 개발할때 비슷한 경우를 공유한적이 있었습니다. lora finetuning 후 EOS token이 안나오는 문제지난번에 LoRA를 학습시키고 EOS 토큰이 나오는 확률이 낮아진거같은데... 어떻게 해결 할 수 있는 방법이 있는가 구글링을 통해서 찾아 보았다. https://towardsdatascience.com/challenges-in-.. 2025. 11. 19.
Deep Agents with LangGraph 안녕하세요! 오늘은 최근 LangChain Academy에서 무료로 수강한 'Project: Deep Agents with LangGraph' 강의를 공유하려고 합니다.LangChain을 사용해 보셨거나, 여러 단계를 거치는 복잡한 AI 에이전트 개발에 관심이 있는 분들이라면 흥미롭게 보실 수 있을 거예요.이 강의는 총 29개의 레슨과 약 1시간 분량의 영상으로 구성되어 있습니다. 짧은 시간이지만 LangGraph를 사용해 상태(State)를 기억하고 스스로 작업을 계획하고 실행하는 AI 에이전트를 만드는 핵심 과정을 단계별로 배울 수 있습니다.체계적인 학습 로드맵 : 각 모듈이 명확한 목표를 가지고 있어, 차근차근 따라가다 보면 어느새 복잡한 기능을 구현하고 있는 자신을 발견하게 됩니다.실용적인 예제 .. 2025. 10. 2.
300x250