본문 바로가기
반응형

전체 글357

[나는 리뷰어다] 기업 AI 정책 담당자 입장에서 읽은 『AI가 두려운 당신에게』 한빛미디어 서평단 활동을 위해서 책을 협찬 받아 작성된 서평입니다. 들어가며 - 제 모니터에는 늘 켜놓는 화면이 두 개 있습니다한쪽 화면에는 회사의 AI 활용 현황의 로그가 흐릅니다. 오늘 몇 건의 질의가 들어왔고, 어떤 문서가 검색되지 않았고, 어떤 테넌트에서 권한 오류가 났는지를 확인합니다. 다른 쪽 화면에는 AI 정책 논문이 열려 있습니다. 이번 학기부터 AI 정책 박사과정을 시작하게 된 저는, 지난 몇 년간 제가 만들어 온 것들이 어떤 제도적 좌표 위에 놓여 있는지를 다시 공부하는 중입니다.AI 리서치 엔지니어의 시간은 스프린트 단위로 흐르고, AI 정책 담당자의 시간은 큰 이벤트와 예산 주기로 흐릅니다. 제 안의 다른 역할 둘은 시간과 관점이 다릅니다. 그러나 목표는 같습니다. 'AI 기술이 .. 2026. 8. 30.
SafeGEO: Understanding Generative Engine Optimization Risks inRecommendation Agents SafeGEO: 추천 에이전트에서의 생성형 엔진 최적화(GEO) 위험 이해하기원문: https://arxiv.org/pdf/2606.28356코드: https://github.com/QianfengWen/SafeGEO📌 한 장 요약문제: LLM 추천 에이전트는 웹에서 긁어온 문서를 근거로 상품을 추천한다. 그런데 그 문서 중 일부는 판매자가 직접 통제하는 페이지다. 판매자가 GEO(생성형 엔진 최적화) 기법으로 그 페이지를 다시 쓰면, 실제로는 요건을 못 맞추는 상품이 근거가 충분한 것처럼 보이게 만들 수 있다.기여: 이 위험을 측정 가능하게 만든 평가 스위트 SafeGEO(22개 공격 변형 × 600개 추천 케이스 = 총 40,800 인스턴스)를 구축.결과: 공격을 받으면 문제 상품이 추천 상위 3.. 2026. 8. 16.
AI 시대에 개발자가 알아야 할 인프라 구성 배포 with 클로드 코드 해당 리뷰는 길벗 출판사에서 책을 제공받아 작성되었습니다.어떤 책인가가상 스타트업 Notiflex가 창업해서 엔터프라이즈 규모로 커지는 여정을 따라가며, 클로드 코드로 인프라를 구축하는 실습서입니다. 2장에서 GKE 클러스터를 만들고, 3장에서 ArgoCD를 붙이고, 4장에 관측 가능성, 5장 무중단 배포, 6~8장에서 캐시·시크릿·멀티 노드풀·카프카·트레이싱까지 올립니다. 각 장이 앞 장의 결과물 위에 쌓이는 구조라 순서대로 가야 합니다. 저자는 CNCF 앰버서더이자 Kubestronaut이고, 전작이 『컨테이너 인프라 환경 구축을 위한 쿠버네티스/도커』와 『한 걸음 앞선 개발자가 지금 꼭 알아야 할 클로드 코드』입니다. 쿠버네티스 쪽과 클로드 코드 쪽을 둘 다 오래 쓴 사람이 쓴 책이라는 게 본문에서.. 2026. 7. 31.
[나는 리뷰어다] 『피지컬 AI 시스템 설계』 우리한테 부족했던 건 모델이 아니었다 한빛미디어 서평단 활동을 위해서 책을 협찬 받아 작성된 서평입니다.https://www.hanbit.co.kr/books/%ED%94%BC%EC%A7%80%EC%BB%AC-ai-%EC%8B%9C%EC%8A%A4%ED%85%9C-%EC%84%A4%EA%B3%84?code=B5960109847이 책을 읽은 이유저는 AI 엔지니어이면서, 그룹 차원의 AI 정책과 거버넌스를 수립하는 일을 합니다.그리고 요즈음의 다른 회사처럼 우리 회사도 피지컬 AI에 관심이 많습니다.피지컬 AI는 저에게 신기술 뉴스가 아니라 당장 판단해야 하는 업무입니다.그런데 회의를 하다 보면 늘 같은 문제에 걸립니다. "피지컬 AI"라는 말을 쓰는 사람마다 뜻이 다릅니다.누구는 휴머노이드를, 누구는 공장 자동화를, 누구는 그냥 AI가 들.. 2026. 7. 26.
UniClawBench: A Universal Benchmark for ProactiveAgents on Real-World Tasks 원문: https://arxiv.org/pdf/2607.08768 Abstract대규모 언어 모델과 멀티모달 대규모 언어 모델의 급속한 발전은 일상적인 도구를 조작하고 실제 환경에서 사용자를 보조할 수 있는 프로액티브 에이전트(proactive agents)의 등장을 가속화했다. 그러나 기존 벤치마크는 이러한 에이전트를 효과적으로 평가하는 데 어려움을 겪는데, 이는 이들이 흔히 샌드박스 환경과 단일 턴(single-turn) 평가 패러다임에 의존하기 때문이다. 더 나아가, 이들의 시나리오 기반 과업 분류 체계는 여러 모델 능력을 동일한 과업 범주 안에 뒤섞어 놓아, 에이전트 실패의 근본 원인을 식별하기 어렵게 만든다.이러한 한계를 해결하기 위해, 우리는 동적인 실세계 환경에서 프로액티브 에이전트를 평가.. 2026. 7. 12.
EvoArena: Tracking Memory Evolutionfor Robust LLM Agents in Dynamic Environments 원문: https://arxiv.org/pdf/2606.13681 EvoArena: Tracking Memory Evolution for Robust LLM Agents in Dynamic Environments (arXiv:2606.13681v1, 2026) 저자: Jundong Xu, Qingchuan Li 외 (National University of Singapore, MIT 등) 프로젝트 페이지: https://aiden0526.github.io/EvoArena/ 코드: https://github.com/Aiden0526/EvoArenaAbstract 대규모 언어 모델(LLM) 에이전트는 다양한 벤치마크에서 강력한 성능을 보여 왔지만, 대부분의 평가는 환경이 정적(static)이라고 가정한다. .. 2026. 6. 14.
개발자가 블로그도 잘 써야 하나요? 해당 리뷰는 길벗 출판사에서 책을 제공받아 작성되었습니다.책을 읽게 된 이유저는 엔터프라이즈 AI 플랫폼을 개발, 운영하는 NLP AI 엔지니어입니다. 업무에서는 RAG 파이프라인 설계, LLM Tool Use 구조 구현, 온톨로지 기반 지식 표현 등을 다루고, 기술 블로그 챌린지에 참여한 지도 어느덧 2년이 넘었습니다.RAG 구현기, 프롬프트 엔지니어링 회고, LLM 성능 비교 실험기 등 다양한 글을 써왔고, 꾸준히 올리는 습관도 자리를 잡았습니다. 그런데도 늘 이런 질문들이 해소되지 않았습니다. "이 글이 기록인가, 아니면 진짜 잘 쓴 글인가?" "왜 어떤 개발자 글은 수천 번 공유되고, 내 글은 조용한가?" "AI를 가장 많이 다루는 내가, 정작 내 글쓰기에 AI를 제대로 활용하고 있는가?" 이 질.. 2026. 5. 27.
AgentSociety: Large-Scale Simulation ofLLM-Driven Generative Agents AdvancesUnderstanding of Human Behaviors and Society 원문: https://arxiv.org/pdf/2502.08691"에이전트 마을을 만들고 싶다"는 생각을 하다가 찾은 논문이다. LLM 기반 에이전트 1만 명을 한 사회에 풀어놓고, 실제 사회 실험(양극화·기본소득·허리케인)을 재현해서 시뮬레이터의 타당성을 검증한다. 코드도 오픈소스로 공개돼 있다. github.com/tsinghua-fib-lab/agentsociety Abstract인간 행동과 사회를 이해하는 것은 사회과학의 핵심 과제로, '생성형 사회과학(Generative Social Science)'의 부상은 중요한 패러다임 전환을 의미한다. 바텀업(bottom-up) 시뮬레이션을 활용함으로써, 비용이 많이 들고 복잡한 전통적 실험을 확장 가능하고 재현 가능하며 체계적인 계산적 접근 방식으로 대.. 2026. 5. 25.
반응형