본문 바로가기
반응형

전체 글358

대규모 언어모델을 활용한 사회·행동과학 분야의 재현성 자동 평가 원문: https://arxiv.org/pdf/2606.13670 Abstract사회·행동과학에서 재현성은 일반적으로 독립적인 연구자들이 원 데이터를 재분석하여 출판된 결과가 복구되는지를 평가하는 방식으로 검증된다. 그러나 이러한 접근은 자원 소모가 크고 확장이 어렵다. 본 연구는 대규모 언어모델(LLM)이 재현성 평가를 자동화할 수 있음을 보인다. 행동·사회과학 분야에서 사전 정의된 주장(claim)을 가진 N = 180편의 출판 연구를 사용하여, LLM이 생성한 분석 결과를 원 논문의 결과와 비교하였다. 11편의 연구에서는 LLM 파이프라인이 유효한 효과크기 추정치를 산출하지 못했다. 나머지 연구에서 LLM은 80%의 사례에서 원 연구와 동일한 질적 결론에 도달했으며, 24%의 연구에서 원래의 효과크.. 2026. 9. 6.
[나는 리뷰어다] 기업 AI 정책 담당자 입장에서 읽은 『AI가 두려운 당신에게』 한빛미디어 서평단 활동을 위해서 책을 협찬 받아 작성된 서평입니다. 들어가며 - 제 모니터에는 늘 켜놓는 화면이 두 개 있습니다한쪽 화면에는 회사의 AI 활용 현황의 로그가 흐릅니다. 오늘 몇 건의 질의가 들어왔고, 어떤 문서가 검색되지 않았고, 어떤 테넌트에서 권한 오류가 났는지를 확인합니다. 다른 쪽 화면에는 AI 정책 논문이 열려 있습니다. 이번 학기부터 AI 정책 박사과정을 시작하게 된 저는, 지난 몇 년간 제가 만들어 온 것들이 어떤 제도적 좌표 위에 놓여 있는지를 다시 공부하는 중입니다.AI 리서치 엔지니어의 시간은 스프린트 단위로 흐르고, AI 정책 담당자의 시간은 큰 이벤트와 예산 주기로 흐릅니다. 제 안의 다른 역할 둘은 시간과 관점이 다릅니다. 그러나 목표는 같습니다. 'AI 기술이 .. 2026. 8. 30.
SafeGEO: Understanding Generative Engine Optimization Risks inRecommendation Agents SafeGEO: 추천 에이전트에서의 생성형 엔진 최적화(GEO) 위험 이해하기원문: https://arxiv.org/pdf/2606.28356코드: https://github.com/QianfengWen/SafeGEO📌 한 장 요약문제: LLM 추천 에이전트는 웹에서 긁어온 문서를 근거로 상품을 추천한다. 그런데 그 문서 중 일부는 판매자가 직접 통제하는 페이지다. 판매자가 GEO(생성형 엔진 최적화) 기법으로 그 페이지를 다시 쓰면, 실제로는 요건을 못 맞추는 상품이 근거가 충분한 것처럼 보이게 만들 수 있다.기여: 이 위험을 측정 가능하게 만든 평가 스위트 SafeGEO(22개 공격 변형 × 600개 추천 케이스 = 총 40,800 인스턴스)를 구축.결과: 공격을 받으면 문제 상품이 추천 상위 3.. 2026. 8. 16.
AI 시대에 개발자가 알아야 할 인프라 구성 배포 with 클로드 코드 해당 리뷰는 길벗 출판사에서 책을 제공받아 작성되었습니다.어떤 책인가가상 스타트업 Notiflex가 창업해서 엔터프라이즈 규모로 커지는 여정을 따라가며, 클로드 코드로 인프라를 구축하는 실습서입니다. 2장에서 GKE 클러스터를 만들고, 3장에서 ArgoCD를 붙이고, 4장에 관측 가능성, 5장 무중단 배포, 6~8장에서 캐시·시크릿·멀티 노드풀·카프카·트레이싱까지 올립니다. 각 장이 앞 장의 결과물 위에 쌓이는 구조라 순서대로 가야 합니다. 저자는 CNCF 앰버서더이자 Kubestronaut이고, 전작이 『컨테이너 인프라 환경 구축을 위한 쿠버네티스/도커』와 『한 걸음 앞선 개발자가 지금 꼭 알아야 할 클로드 코드』입니다. 쿠버네티스 쪽과 클로드 코드 쪽을 둘 다 오래 쓴 사람이 쓴 책이라는 게 본문에서.. 2026. 7. 31.
[나는 리뷰어다] 『피지컬 AI 시스템 설계』 우리한테 부족했던 건 모델이 아니었다 한빛미디어 서평단 활동을 위해서 책을 협찬 받아 작성된 서평입니다.https://www.hanbit.co.kr/books/%ED%94%BC%EC%A7%80%EC%BB%AC-ai-%EC%8B%9C%EC%8A%A4%ED%85%9C-%EC%84%A4%EA%B3%84?code=B5960109847이 책을 읽은 이유저는 AI 엔지니어이면서, 그룹 차원의 AI 정책과 거버넌스를 수립하는 일을 합니다.그리고 요즈음의 다른 회사처럼 우리 회사도 피지컬 AI에 관심이 많습니다.피지컬 AI는 저에게 신기술 뉴스가 아니라 당장 판단해야 하는 업무입니다.그런데 회의를 하다 보면 늘 같은 문제에 걸립니다. "피지컬 AI"라는 말을 쓰는 사람마다 뜻이 다릅니다.누구는 휴머노이드를, 누구는 공장 자동화를, 누구는 그냥 AI가 들.. 2026. 7. 26.
UniClawBench: A Universal Benchmark for ProactiveAgents on Real-World Tasks 원문: https://arxiv.org/pdf/2607.08768 Abstract대규모 언어 모델과 멀티모달 대규모 언어 모델의 급속한 발전은 일상적인 도구를 조작하고 실제 환경에서 사용자를 보조할 수 있는 프로액티브 에이전트(proactive agents)의 등장을 가속화했다. 그러나 기존 벤치마크는 이러한 에이전트를 효과적으로 평가하는 데 어려움을 겪는데, 이는 이들이 흔히 샌드박스 환경과 단일 턴(single-turn) 평가 패러다임에 의존하기 때문이다. 더 나아가, 이들의 시나리오 기반 과업 분류 체계는 여러 모델 능력을 동일한 과업 범주 안에 뒤섞어 놓아, 에이전트 실패의 근본 원인을 식별하기 어렵게 만든다.이러한 한계를 해결하기 위해, 우리는 동적인 실세계 환경에서 프로액티브 에이전트를 평가.. 2026. 7. 12.
EvoArena: Tracking Memory Evolutionfor Robust LLM Agents in Dynamic Environments 원문: https://arxiv.org/pdf/2606.13681 EvoArena: Tracking Memory Evolution for Robust LLM Agents in Dynamic Environments (arXiv:2606.13681v1, 2026) 저자: Jundong Xu, Qingchuan Li 외 (National University of Singapore, MIT 등) 프로젝트 페이지: https://aiden0526.github.io/EvoArena/ 코드: https://github.com/Aiden0526/EvoArenaAbstract 대규모 언어 모델(LLM) 에이전트는 다양한 벤치마크에서 강력한 성능을 보여 왔지만, 대부분의 평가는 환경이 정적(static)이라고 가정한다. .. 2026. 6. 14.
개발자가 블로그도 잘 써야 하나요? 해당 리뷰는 길벗 출판사에서 책을 제공받아 작성되었습니다.책을 읽게 된 이유저는 엔터프라이즈 AI 플랫폼을 개발, 운영하는 NLP AI 엔지니어입니다. 업무에서는 RAG 파이프라인 설계, LLM Tool Use 구조 구현, 온톨로지 기반 지식 표현 등을 다루고, 기술 블로그 챌린지에 참여한 지도 어느덧 2년이 넘었습니다.RAG 구현기, 프롬프트 엔지니어링 회고, LLM 성능 비교 실험기 등 다양한 글을 써왔고, 꾸준히 올리는 습관도 자리를 잡았습니다. 그런데도 늘 이런 질문들이 해소되지 않았습니다. "이 글이 기록인가, 아니면 진짜 잘 쓴 글인가?" "왜 어떤 개발자 글은 수천 번 공유되고, 내 글은 조용한가?" "AI를 가장 많이 다루는 내가, 정작 내 글쓰기에 AI를 제대로 활용하고 있는가?" 이 질.. 2026. 5. 27.
반응형