AI 위클리: Gemini 3.5 Flash 컴퓨터 사용, 엔터프라이즈 데이터 프라이버시 갭, RAG 청킹 실패, 그리고 신규 arXiv 논문 8편
이번 주 AI 주요 소식: Gemini 3.5 Flash의 컴퓨터 사용 기능 공개, 기업 LLM 도입 시 간과되는 데이터 프라이버시 갭, RAG 실패의 진짜 원인인 청킹 문제, OpenAI Codex 사용량 리셋, 그리고 최신 arXiv 논문 8편을 정리했습니다.
Gemini 3.5 Flash, 컴퓨터 사용 기능 획득
DeepMind는 Gemini 3.5 Flash에 컴퓨터 사용 기능을 발표하며, 모델이 버튼 클릭, 텍스트 입력, 애플리케이션 탐색, 화면 읽기 등 컴퓨터 인터페이스와 상호작용할 수 있게 했습니다. 사람처럼 소프트웨어를 조작할 수 있는 범용 AI 에이전트를 향한 중요한 진전입니다. 이 기능은 안전한 실행을 위한 매니지드 샌드박스 환경과 함께 Gemini API를 통해 제공됩니다.
엔터프라이즈 LLM 통합: 팀들이 놓치는 데이터 프라이버시 갭
Shakthi(@v_shakthi)는 엔터프라이즈 LLM 도입에서 중대한 사각지대를 짚었습니다. 대부분의 팀은 프롬프트에 들어가는 데이터를 분류하는 데는 공을 들이지만, 그 데이터가 프롬프트를 떠난 이후 — 벤더, 하위처리자, 로그, 보관 정책이 이를 어떻게 다루는지 — 에는 거의 관심을 두지 않습니다. 핵심 메시지는 이렇습니다: 데이터 분류는 벤더 계약, 하위처리자, 로깅, 보관 조건을 포함한 전체 생애주기로 확장되어야 합니다.
RAG 실패는 모델이 아니라 청킹의 실패
같은 소스는 대부분의 RAG 실패가 모델의 한계가 아니라 부실한 청킹 전략에서 비롯된다고 지적합니다. 의미 경계를 고려하지 않고 임의의 토큰 경계에서 문서를 자르면 의미가 파괴됩니다. 조항 간 의존성과 조건부 로직이 있는 법률·규제 문서가 특히 취약합니다. 토큰 수 기반 청킹은 핵심 문맥을 깨뜨려, 모델 품질과 무관하게 검색을 신뢰할 수 없게 만듭니다.
OpenAI Codex, 전체 사용량 리셋 실행
OpenAI의 Codex 팀은 적립된 한도를 포함해 전체 사용자를 대상으로 사용량을 전면 리셋했습니다. Tibo Sottiaux는 팀이 예상치 못한 사용량 소진을 조사하는 일요일 워룸을 운영했다고 확인했습니다. 이번 리셋은 에이전틱 AI 도구의 운영상 과제를 부각시킵니다 — 엔터프라이즈급 AI 도구는 이러한 시스템이 프로덕션 워크플로에 편입됨에 따라 프로덕션 준비성, 비용 통제, 투명한 사용량 관리를 갖춰야 합니다.
엔지니어링 스택으로서의 현대 AI
VizuaraAI는 현대 AI를 조합 가능한 아이디어들의 스택으로 그려냅니다: 토큰화, 어텐션, RAG, 디퓨전, 비전 모델, 월드 모델이 함께 작동하는 구조입니다. 이러한 관점은 AI를 '마법'에서 '엔지니어링'으로 옮겨놓습니다 — 구성 요소를 이해하면 시스템을 다룰 수 있게 됩니다. 이 교육 콘텐츠는 빠르게 진화하는 AI 아키텍처를 탐색하는 실무자들에게 유용한 사고 모델이 됩니다.
트랜스포머 이전의 메모리 아키텍처: RNN, LSTM, GRU
트랜스포머 이전, RNN은 메모리를 가진 최초의 신경망으로서 은닉 상태(hidden state)를 시간에 따라 전달하며 과거 맥락과 미래 예측을 연결했습니다. 기울기 소실 문제는 LSTM과 GRU의 등장으로 이어졌고, 이는 결국 트랜스포머 아키텍처에 자리를 내주었습니다. 이러한 기초를 되짚는 일은 현재의 LLM과 생성 AI를 형성한 설계 제약과 트레이드오프를 이해하는 데 여전히 가치가 있습니다.
Google 생태계 업데이트
- Gemini API Managed Agents: 3.6 Flash, 훅, 그리고 에이전틱 워크플로 구축을 위한 개발자 도구가 추가로 확장됐습니다.
- 검색의 AI 모드: 새로운 검색 모드가 실제 시나리오에서 사용자를 돕는 다섯 가지 실용적인 방법.
- Gemini Robotics ER 2: 로보틱스를 위한 비디오 이해, 태스크 오케스트레이션, 멀티 로봇 협업.
- Gemini Robotics 2: 로봇 조작을 위한 전신 지능(whole-body intelligence).
- Google Flow Music의 Lyria 3.5: AI 음악 생성의 음악성, 가사, 보컬, 창작 제어 측면 발전.
Microsoft Research의 기여
- Echoverse: 컴퓨터 사용 에이전트를 위한 심층적이고 진화하는 환경으로, 에이전트 평가를 위한 풍부한 시뮬레이션 기반을 제공합니다.
- EvoLib: 경험을 진화하는 지식으로 전환하는 프레임워크로, 상호작용으로부터 지속적으로 학습하는 시스템을 가능케 합니다.
Anthropic 연구 포털
Anthropic의 연구 페이지는 안전성, 해석가능성, 정렬(alignment) 연구를 계속 발행하고 있습니다 — 프론티어 모델 거버넌스를 추적하는 핵심 자료입니다.
커뮤니티 자료 (Hacker News 하이라이트)
- Machine Learning Crash Course (Google Developers): 1,926포인트 — ML 기초를 아우르는 종합 입문 과정.
- ML 101 Slidedeck: "2 years of headbanging, so you don't have to" — 1,656포인트 — ML 엔지니어링 교훈을 실용적으로 압축.
최근 arXiv 논문 (신규 제출 8편)
| 제목 | 링크 | 초점 영역 |
|---|---|---|
| Learning to Trace Seiberg Dualities | arXiv:2607.28628 | 이론물리학 / ML |
| ReToken: One Token to Improve Vision-Language Models for Visual Retrieval | arXiv:2607.28627 | 비전-언어 / 검색 |
| AskChem: Claim-Centered Infrastructure for Chemistry Literature Synthesis | arXiv:2607.28618 | 화학 / LLM 응용 |
| KAISEN: Reproducible Subgroup Fairness Auditing for Clinical Risk Models | arXiv:2607.28608 | 공정성 / 임상 AI |
| Change2Task: From Repository Changes to Executable Coding Agent Tasks | arXiv:2607.28591 | 코딩 에이전트 / 소프트웨어 공학 |
| PAC-MAN: Perception-Aware CBF-RL for Whole-Body Safety in Humanoid Dodgeball | arXiv:2607.28623 | 로보틱스 / RL / 안전 |
| AISPA: User-Centric System Prompt Auditing for LLM Applications | arXiv:2607.28617 | LLM 안전 / 프롬프트 감사 |
| ACE-Data-0: Human-Centric Ambient Capture as Embodied Data Engine | arXiv:2607.28625 | 구현 AI / 데이터 수집 |
이 논문들은 이론적 기초부터 실용적인 검색 개선, 도메인 특화 LLM 응용(화학, 임상), 코딩 에이전트, 로보틱스 안전, 프롬프트 보안, 구현 데이터에 이르기까지 폭넓게 걸쳐 있어 현재 ML 연구의 다양성을 보여줍니다.
한국어 요약
이번 주 AI 주요 소식을 정리했습니다. Gemini 3.5 Flash가 컴퓨터 사용 기능을 추가해 화면 읽기, 클릭, 타이핑 등 사람처럼 소프트웨어를 조작할 수 있게 되었습니다. 기업 LLM 도입 시 데이터 프라이버시 갭이 간과되고 있습니다 — 프롬프트 입력 데이터 분류에만 집중하고, 벤더·하위처리자·로그·보관 정책 등 데이터가 프롬프트를 떠난 후 처리 방식을 놓치는 경우가 많습니다. RAG 실패의 진짜 원인은 모델이 아니라 청킹(문서 분할) 문제입니다. 의미 단위 무시하고 토큰 수로만 자르면 문맥이 깨져 검색 품질이 떨어집니다. OpenAI Codex가 전 사용자 대상 사용량 리셋을 실행해 에이전틱 AI 도구의 운영 과제(비용 통제, 사용량 투명성)를 보여주었습니다. 현대 AI를 토큰화·어텐션·RAG·디퓨전·비전·월드 모델이 쌓인 엔지니어링 스택으로 이해하면 '마법'이 아닌 '공학'으로 다가옵니다. RNN→LSTM→GRU→Transformer로 이어진 메모리 아키텍처 계보를 되짚으면 현재 LLM 설계의 제약과 트레이드오프를 이해하는 데 도움이 됩니다. 구글(제미나이 API 매니지드 에이전트, AI 모드 검색, 로보틱스, 리리아 3.5), MS Research(에코버스, 에볼리브), 앤트로픽 연구 포털, 그리고 arXiv 신규 논문 8편(시버그 이중성 추적, ReToken, AskChem, KAISEN, Change2Task, PAC-MAN, AISPA, ACE-Data-0)도 함께 다뤘습니다.
주요 용어: 컴퓨터 사용(Computer Use) · 데이터 프라이버시 갭(Data Privacy Gap) · 청킹(Chunking) · 에이전틱 AI(Agentic AI) · RAG(Retrieval-Augmented Generation) · 토큰화(Tokenization) · 어텐션(Attention) · 월드 모델(World Model) · 시버그 이중성(Seiberg Duality) · 공정성 감사(Fairness Auditing)
관련 글
ChatGPT 광고, 출시 200일 만에 연 10억 달러 매출 기록
OpenAI가 ChatGPT Ads의 연간 매출 추이를 10억 달러로 밝히고 인도·유럽·중동·북아프리카에서 셀프서비스 광고를 확대했다. 무료 티어를 유지하려면 광고가 필수인데, 실제로 그 모델이 성장 궤도에 올랐다는 점에서 AI 산업의 수익 구조가 바뀌고 있음을 확인할 수 있다.
OpenAI, 태국 AI 스타트업 10곳과 8주 액셀러레이터를 시작한다
OpenAI가 태국 MHESI와 8주 액셀러레이터를 시작해 의료·웰니스·교육 AI 스타트업 10곳을 선발했다. 참가 팀每人에 2,000달러 API 크레딧과 전용 멘토가 배정되고, 11월 방콕 Demo Day로 프로그램이 마무리된다.
구글, 제미니 노트북에 '엑스퍼트 인텔리전스' 론칭
구글이 8월 27일 제미니 노트북에 엑스퍼트 인텔리전스를 도입해, 사용자가 Google Play Books에서 구매한 전자책과 저자·출판사·전문가 콘텐츠를 직접 연결해 질의하고 활용할 수 있게 됐다. 10만 권 이상의 도서로 시작하며, 향후 구독 뉴스레터·보고서 등으로 확장될 예정이다.
발행 전 운영자가 직접 큐레이션·검수·편집합니다.