모델 발전 시대에 오래 남는 AI 자산
모델의 약점을 임시로 보완하는 하네스는 빠르게 낡지만, 현실의 요구사항·실패 증거·평가·권한·책임을 다루는 자산은 모델이 강해질수록 더 중요해진다.
- ai-agents
- harness-engineering
- evals
- product-planning
- +5
Deep Research처럼 기다릴 가치 있는 AI 보고서를 정리합니다.
공개 노트 32개
모델의 약점을 임시로 보완하는 하네스는 빠르게 낡지만, 현실의 요구사항·실패 증거·평가·권한·책임을 다루는 자산은 모델이 강해질수록 더 중요해진다.
OpenClaw는 채널·Gateway·세션·플러그인을 묶는 운영 플랫폼으로, Hermes Agent는 장기 목표·증거 검증·학습을 밀어붙이는 자율 에이전트 하네스로 더 성숙했다.
Artificial Analysis Intelligence Index를 기준으로 GPT-5.6의 Luna·Terra·Sol 계열을 비교하면, 일반적인 코딩·분석 기본값은 Sol low이고 비용을 더 중시할 때는 Luna low가 유리하다.
Vercel의 Next.js 16 API 에이전트 실험을 바탕으로, AGENTS.md의 persistent docs index가 skill 기반 on-demand retrieval보다 안정적으로 동작한 이유와 실무 적용 기준을 정리한 노트.
11개 AI 코딩 에이전트 세팅을 같은 과제와 같은 검증 기준으로 비교해, 토큰 총량보다 guard, self-review, 독립 검증이 코드 품질을 더 잘 설명한다는 점을 정리한 실험 노트.
Obsidian을 AI 에이전트의 장기 지식 저장소로 쓰기 위한 도구 조합, vault 구조, AGENTS.md 규칙, 최소 skill, MCP 도입 기준을 정리한 퀵스타트.
AI 에이전트의 지속성, 소유권, 재현성, 포크, 디버깅 가능성을 모델이 아니라 append-only 이벤트 로그 중심으로 재설계해야 한다는 주장과 근거를 정리한 리포트.
에이전트 skill과 MCP 서버가 많아질 때 쓸 수 있는 CLI, 패키지 매니저, 게이트웨이, 보안 스캐너를 나누어 보고, 개인·팀·조직 단위 도입 기준을 정리한 노트.
프롬프트가 변경 전보다 실제로 나아졌는지 판단하기 위한 평가 구조, 품질 지표, 통계 기준, 도구 선택지를 정리한 노트.
AI 에이전트로 프론트엔드를 만들 때 제네릭하고 비슷한 UI를 줄이기 위한 디자인 컨텍스트, taste-skill, 프롬프트, MCP, QA 루프, 도구 스택을 정리한 노트.
Claude Code, Codex, Gemini CLI 같은 코딩 에이전트를 여러 세션으로 실행·감시·격리·오케스트레이션하는 프로젝트를 star 순으로 정리하고 실사용 후보를 나눈 노트.
n8n을 내부 업무 자동화와 AI 워크플로 오케스트레이션에 쓰기 위한 설치, 운영, 보안, AI Agent 활용 기준을 정리한 노트.
2026년 6월 11일 기준으로 한국에서 지원 가능성이 높게 확인된 AI 평가, 데이터 라벨링, 코딩·분석 원격 플랫폼을 선별한 노트.
2026년 6월 26일 기준으로 무료 API key, 무료 모드, trial credit이 명시된 LLM API 후보를 구분해 정리한 노트.
Karpathy가 제안한 LLM Wiki를 RAG, GraphRAG, 장기 메모리 흐름과 비교하고, 개인·팀 지식베이스에 적용할 운영 원칙을 정리한 노트.
서브에이전트를 언제 쓰고, 어떻게 분리하고, 어떤 실패 패턴을 피해야 하는지 2026년 기준 공식 문서, 실무 글, 논문, 레포 흐름으로 정리한 노트.
AI agent 개발에서 코드 생성보다 어려워진 의도 보존, 검증, judge 설계 문제를 논문, 업계 글, 도구 흐름과 함께 정리한 노트.