
AI 에이전트가 스킬을 고르지 않거나 엉뚱한 절차를 밟는다면 SKILL.md를 살펴야 합니다. 실제 파일 238개를 분석한 연구가 찾아낸 결함 유형과 이를 개선하는 8가지 방법, 업무용 스킬 5개에 직접 적용한 결과를 정리했습니다.

이 글은 에이전트 옵저버빌리티의 개념과 동작 방식, APM·LLM 옵저버빌리티와의 차이, 구현 도구를 살펴봅니다. 아울러 Langfuse와 Google Gemini로 PR 리뷰 에이전트의 활동을 추적·평가하는 실습을 다룹니다. 또 에이전트 옵저버빌리티를 원활하게 운영하기 위해 유념할 사항도 알아봅니다.

개발팀 성과를 경영진 보고로 정리하는 데 며칠씩 걸리시나요? 2024년 이후 BI에서 DevOps로 확장된 생성형 AI 데이터 분석, 그리고 GitLab Data Analyst Agent와 인포그랩 Mantis가 이를 자연어 한 줄로 바꾸는 방식을 살펴봅니다.

AI 에이전트는 프롬프트, RAG, MCP, 도구 호출, 다단계 추론 등을 결합해 자율적으로 동작합니다. 따라서 성능을 정확히 측정하려면 이러한 특성을 고려한 전용 평가 방법이 필요합니다. 이 글은 에이전트 성능 평가 시 고려 사항, LLM-as-a-Judge 평가 방식, 도구 호출·사용 능력 평가 방법, NEXA 적용 사례와 결과를 다뤘습니다.

이 글은 AI 에이전트를 중심으로 보안 취약점 관리 자동화 기술 동향을 다뤘습니다. Claude Code는 자동 보안 리뷰 기능으로 보안 문제 검사와 수정을 지원합니다. Opus Security는 멀티 에이전트 기반 자율형 취약점 관리 플랫폼으로 취약점 분석과 시정 조치를 자동화합니다. Cycode는 AI 악용 가능성 분석으로 고위험 취약점을 신속하게 확인합니다. DeepSource는 완전 자율 에이전트 방식으로 리포지터리를 모니터링하고, 의사결정을 내리며, 적절한 조치를 취합니다.