LLM 프롬프트 캐싱 개념 정리 (Prompt Caching)

같은 프롬프트를 매번 다시 처리하지 않도록 캐시하는 프롬프트 캐싱의 전략과 동작 원리, 비용 구조를 정리했다.

2026년 7월 20일

Teams 알람 기반 RCA 멀티 에이전트 설계

Teams 알람에 봇을 멘션하면 전문 에이전트들이 원인을 분석해 응답하는 RCA 워크플로우 설계.

2026년 6월 8일

DevOps 운영에 LLM을 붙일 때 2단계 구조를 고민한 이유

운영 로그 분석에 LLM을 붙일 때 비용과 정확도를 같이 잡기 위한 2단계 구조를 구상했다.

2026년 6월 5일

faster-whisper·Ollama·TTS로 로컬 음성 비서 구축

홈서버에 붙여온 STT·LLM·TTS를 묶어서 말로 부르면 답하는 로컬 어시스턴트까지 만들었다.

2026년 5월 13일

Gemma 4B LoRA 파인튜닝: 카카오톡 말투 학습

Gemma 4B LoRA 학습을 구형 GPU 두 장에 분산하고 데이터 정제와 평가 결과를 확인했다.

2026년 4월 20일

초소형 LLM 벤치마크: SmolLM2 135M부터 비교

SmolLM2 135M과 Llama 3.2 3B를 실행해 기본 응답 품질을 확인한 기록이다.

2026년 4월 12일

Claude·Codex·Gemini 멀티 에이전트 오케스트레이터 구현

CLI 코딩 에이전트 세 개를 역할별로 나눠 한 팀처럼 구성해 봤다. 워크트리 격리와 세션 복구까지 함께 정리했다.

2026년 4월 8일

Maxwell GPU에서 Ollama 성능 개선: Flash Attention 비활성화

Maxwell GPU에서 Flash Attention을 비활성화해 Ollama 생성 속도를 개선한 과정을 정리했다.

2026년 4월 5일

LLM과 Python으로 자연어 확률 문제 풀이 앱 만들기

LLM은 자연어 조건을 구조화하고 Python 조합론 엔진은 계산을 담당하도록 역할을 분리한 학습용 앱.

2026년 3월 14일

Azure AI Foundry 앞단에 사내 LLM Gateway 구축

Gemini에서 Foundry로 옮기며 앞단 게이트웨이가 없어 사내 LLM 게이트웨이를 직접 만든 과정을 정리했다.

2025년 9월 30일