LLM 프롬프트 캐싱 개념 정리 (Prompt Caching)
같은 프롬프트를 매번 다시 처리하지 않도록 캐시하는 프롬프트 캐싱의 전략과 동작 원리, 비용 구조를 정리했다.
같은 프롬프트를 매번 다시 처리하지 않도록 캐시하는 프롬프트 캐싱의 전략과 동작 원리, 비용 구조를 정리했다.
Teams 알람에 봇을 멘션하면 전문 에이전트들이 원인을 분석해 응답하는 RCA 워크플로우 설계.
운영 로그 분석에 LLM을 붙일 때 비용과 정확도를 같이 잡기 위한 2단계 구조를 구상했다.
홈서버에 붙여온 STT·LLM·TTS를 묶어서 말로 부르면 답하는 로컬 어시스턴트까지 만들었다.
Gemma 4B LoRA 학습을 구형 GPU 두 장에 분산하고 데이터 정제와 평가 결과를 확인했다.
SmolLM2 135M과 Llama 3.2 3B를 실행해 기본 응답 품질을 확인한 기록이다.
CLI 코딩 에이전트 세 개를 역할별로 나눠 한 팀처럼 구성해 봤다. 워크트리 격리와 세션 복구까지 함께 정리했다.
Maxwell GPU에서 Flash Attention을 비활성화해 Ollama 생성 속도를 개선한 과정을 정리했다.
LLM은 자연어 조건을 구조화하고 Python 조합론 엔진은 계산을 담당하도록 역할을 분리한 학습용 앱.
Gemini에서 Foundry로 옮기며 앞단 게이트웨이가 없어 사내 LLM 게이트웨이를 직접 만든 과정을 정리했다.