Gemini 3.5 Flash의 컴퓨터 사용 기능
Google DeepMind가 Gemini 3.5 Flash에 컴퓨터 사용 기능을 기본 탑재했다고 발표했습니다. 브라우저·모바일·데스크톱을 넘나드는 에이전트 자동화와 함께, 안전장치와 운영 방식까지 같이 봐야 할 시점입니다.
한 줄 요약
Google DeepMind는 2026년 6월 24일, Gemini 3.5 Flash에 computer use를 기본 도구로 넣었다고 밝혔습니다. 이전에는 별도 모델로 제공되던 기능이 메인 Flash 모델에 통합된 셈이라, 에이전트 자동화의 진입점이 한 단계 낮아졌습니다.
무엇이 달라졌나
핵심 변화는 단순합니다. 모델이 텍스트를 이해하는 수준을 넘어서, 브라우저·모바일·데스크톱 환경에서 실제 UI를 보고 행동하도록 설계됐다는 점입니다. Google은 이 기능을 Gemini API와 Gemini Enterprise Agent Platform에서 사용할 수 있다고 설명했습니다.
| 항목 | 이전 | 지금 |
|---|---|---|
| 제공 형태 | 별도 computer use 모델 | Gemini 3.5 Flash 내장 |
| 대상 환경 | 주로 제한된 컴퓨터 사용 시나리오 | 브라우저·모바일·데스크톱 |
| 활용 방향 | 실험적 자동화 | 장기 과제, 엔터프라이즈 자동화 |
왜 중요한가
이 변화는 단순한 기능 추가보다 에이전트 설계 방식에 더 큰 영향을 줍니다. 같은 모델 안에서 추론과 UI 조작이 이어지면, 장기 작업을 끊김 없이 이어 가기 쉬워집니다. 예를 들면 지속적인 소프트웨어 테스트, 업무용 웹앱 조작, 사내 지식 작업처럼 반복성과 맥락 유지가 중요한 업무에 더 잘 맞습니다.
Google가 예시로 든 시나리오도 이 방향과 맞닿아 있습니다. Gemini 앱의 기능을 분류하거나, 문서를 훑어 접근성 문제를 점검하는 식의 작업은 UI를 읽고 판단한 뒤 다시 행동하는 흐름이 필요하기 때문입니다.
안전장치는 같이 봐야 합니다
UI를 직접 건드리는 에이전트는 편리한 만큼 위험도 함께 늘어납니다. DeepMind는 프롬프트 인젝션 위험을 줄이기 위해 targeted adversarial training을 적용했다고 밝혔고, 기업용 보호 장치도 옵션으로 제공한다고 설명했습니다.
실무에서는 다음을 같이 두는 편이 안전합니다.
| 체크 항목 | 이유 |
|---|---|
| 샌드박스 실행 | 실제 계정·데이터 오염을 줄이기 위해 |
| human-in-the-loop | 결제·삭제·외부 전송 같은 민감 작업 제어 |
| 접근 권한 분리 | 에이전트가 볼 수 있는 범위를 최소화 |
| 로그 저장 | 오작동과 보안 이슈를 추적하기 위해 |
지금 볼 포인트
이 소식의 핵심은 "AI가 화면을 이해한다"가 아니라, "에이전트 워크플로를 더 자연스럽게 제품화할 수 있다"는 점입니다. 다만 실제 운영에서는 모델 성능보다 권한 설계, 실패 복구, 감시 체계가 더 중요할 가능성이 큽니다.
관련 글
ChatGPT 광고, 출시 200일 만에 연 10억 달러 매출 기록
OpenAI가 ChatGPT Ads의 연간 매출 추이를 10억 달러로 밝히고 인도·유럽·중동·북아프리카에서 셀프서비스 광고를 확대했다. 무료 티어를 유지하려면 광고가 필수인데, 실제로 그 모델이 성장 궤도에 올랐다는 점에서 AI 산업의 수익 구조가 바뀌고 있음을 확인할 수 있다.
OpenAI, 태국 AI 스타트업 10곳과 8주 액셀러레이터를 시작한다
OpenAI가 태국 MHESI와 8주 액셀러레이터를 시작해 의료·웰니스·교육 AI 스타트업 10곳을 선발했다. 참가 팀每人에 2,000달러 API 크레딧과 전용 멘토가 배정되고, 11월 방콕 Demo Day로 프로그램이 마무리된다.
구글, 제미니 노트북에 '엑스퍼트 인텔리전스' 론칭
구글이 8월 27일 제미니 노트북에 엑스퍼트 인텔리전스를 도입해, 사용자가 Google Play Books에서 구매한 전자책과 저자·출판사·전문가 콘텐츠를 직접 연결해 질의하고 활용할 수 있게 됐다. 10만 권 이상의 도서로 시작하며, 향후 구독 뉴스레터·보고서 등으로 확장될 예정이다.
발행 전 운영자가 직접 큐레이션·검수·편집합니다.