AI 에이전트는 디지털 인터페이스와 물리 세계를 넘나들며 점점 더 복잡한 작업을 수행하고 있습니다. 이처럼 다양한 환경에서 인식하고 처리하며 동작하는 능력은 자동화, 인간-컴퓨터 상호작용, 지능형 시스템 전반을 근본적으로 바꾸고 있습니다.
이 장은 에이전트가 컴퓨터, 그리고 주변 환경과 어떻게 상호작용하는지를 살펴보고, 관련 발전과 주요 프로젝트를 함께 조명합니다. 앞선 장들이 “에이전트를 어떻게 설계하는가”를 다뤘다면, 이 장은 “에이전트의 손과 눈이 어디까지 닿는가” 에 대한 현황 보고에 가깝습니다.
API·시스템 호출 GUI 조작 물리 환경
┌──────────────┐ ┌──────────────┐ ┌──────────────┐
│ 개발자가 짠 │ │ 화면을 보고 │ │ 카메라·마이크로 │
│ 스크립트 자동화 │ ───▶ │ 클릭·입력·스크롤 │ ─────▶ │ 보고 듣고 대화 │
│ (경직됨) │ │ (ACI) │ │ (멀티모달 실시간) │
└──────────────┘ └──────────────┘ └──────────────┘
Operator · Mariner Astra · Gemini Live
Computer Use GPT-4o · Seeing AI
Browser Use
상호작용: 에이전트와 컴퓨터
AI가 단순한 대화 상대를 넘어 능동적이고 작업 지향적인 에이전트로 발전하는 흐름은 에이전트-컴퓨터 인터페이스(Agent-Computer Interface, ACI) 가 이끌고 있습니다. 이 인터페이스를 통해 AI는 컴퓨터의 그래픽 사용자 인터페이스(GUI)와 직접 상호작용하면서, 아이콘이나 버튼 같은 시각 요소를 사람처럼 인식하고 조작할 수 있습니다.
이는 API와 시스템 호출에 의존하던 기존 자동화, 곧 개발자 손에 묶인 경직된 스크립트 방식을 넘어서는 새로운 접근이다. 이제 AI는 소프트웨어의 시각적 “정문” 을 통해 복잡한 디지털 작업을 더 유연하고 강력하게 자동화할 수 있다.
5장의 도구 사용이 누군가 미리 만들어 둔 API라는 뒷문으로 들어가는 방식이었다면, ACI는 사람이 쓰는 화면이라는 정문으로 들어갑니다. API가 없는 레거시 시스템이나, 서비스마다 API가 제각각인 작업에서도 에이전트가 움직일 수 있다는 뜻입니다.
이 과정은 몇 가지 핵심 단계로 이뤄집니다.
| 단계 | 무엇을 하는가 |
|---|---|
| 시각 인식 | 에이전트는 먼저 화면을 시각 정보로 포착한다. 사실상 스크린샷을 찍는 단계다 |
| GUI 요소 인식 | 이미지를 분석해 여러 GUI 요소를 구분한다. 화면을 단순한 픽셀 집합이 아니라 상호작용 가능한 구성요소가 배치된 구조화된 레이아웃으로 “보는” 법을 익혀야 한다. 클릭 가능한 “Submit” 버튼과 고정된 배너 이미지, 편집할 수 있는 텍스트 필드와 단순한 레이블을 가려낼 수 있어야 한다 |
| 맥락 해석 | ACI 모듈은 시각 데이터와 에이전트의 핵심 지능(대개 LLM)을 잇는 다리다. 작업 맥락에 맞게 화면 요소를 해석한다. 돋보기 아이콘은 대개 “검색”을 뜻하고, 동그란 선택 버튼이 여러 개 나열된 형태는 선택지를 나타낸다는 식이다. 시각적 근거에 기반해 계획을 세울 수 있게 하는 핵심 축이다 |
| 상황에 따른 동작과 대응 | 마우스와 키보드를 프로그래밍 방식으로 제어해 계획을 실행한다. 클릭하고, 입력하고, 스크롤하고, 드래그한다. 핵심은 화면의 시각적 피드백을 끊임없이 살피는 일이다. 그래야 화면 변화, 로딩 화면, 팝업 알림, 오류에 그때그때 대응하면서 다단계 워크플로를 끝까지 수행할 수 있다 |
마지막 단계가 결국 루프라는 점이 중요합니다. 스크린샷을 찍고, 해석하고, 동작하고, 다시 스크린샷을 찍어 결과를 확인합니다. 22장의 ReAct에서 Observation 자리에 텍스트 대신 화면 이미지가 들어간 형태입니다.
┌──────────────┐
┌───▶│ ① 스크린샷 │ 시각 인식
│ └──────┬───────┘
│ ▼
│ ┌──────────────┐
│ │ ② 요소 구분 │ 버튼? 배너? 입력칸? 레이블?
│ └──────┬───────┘
│ ▼
│ ┌──────────────┐
│ │ ③ 맥락 해석 │ LLM: "돋보기 = 검색, 다음엔 검색창 클릭"
│ └──────┬───────┘
│ ▼
│ ┌──────────────┐
└────┤ ④ 마우스·키보드 │ 클릭·입력·스크롤·드래그
└──────────────┘
화면 변화·로딩·팝업·오류를 다음 스크린샷에서 확인
이 기술은 더 이상 이론에 머물지 않습니다. 여러 주요 AI 연구소가 GUI 상호작용의 힘을 실제로 보여 주는 에이전트를 이미 개발했습니다.
ChatGPT Operator(오픈AI)
ChatGPT Operator는 디지털 파트너를 지향하며, 데스크톱에서 다양한 애플리케이션 작업을 직접 자동화하도록 설계되었습니다. 화면 요소를 이해할 수 있기 때문에 스프레드시트 데이터를 고객 관계 관리(CRM) 플랫폼으로 옮기고, 항공사와 호텔 웹사이트를 넘나들며 복잡한 여행 일정을 예약하고, 서비스마다 전용 API에 접근하지 않고도 상세한 온라인 양식을 작성할 수 있습니다. 반복적인 디지털 잡무를 대신 처리해 개인과 기업 모두의 생산성을 높이는, 어디에나 맞춰 쓸 수 있는 도구를 지향합니다.
구글 Project Mariner
연구 프로토타입인 Project Mariner는 크롬 브라우저 안에서 에이전트로 동작합니다. 사용자의 의도를 이해하고, 사용자를 대신해 웹 기반 작업을 자율적으로 수행하는 것이 목적입니다. 예를 들어 특정 예산과 지역 조건에 맞는 임대 아파트 세 곳을 찾아 달라고 하면, Mariner는 부동산 웹사이트로 이동해 필터를 적용하고 매물을 살펴본 뒤 관련 정보를 문서로 추출할 수 있습니다. 브라우저가 사용자를 대신해 능동적으로 일하는, 진정으로 유용한 “에이전틱” 웹 경험을 만들려는 구글의 시도입니다.
┌─────────────────────────────────────────────┐
│ ┌──────────────┐ ┌────────────┐ │
│ │ ( WWW ) │ ─────▶ │ ┌──────┐ │ │
│ │ │ │ │ AI │ │ │
│ │ │ ◀───── │ └──────┘ │ │
│ └──────────────┘ └────────────┘ │
│ 웹 브라우저 에이전트 │
└─────────────────────────────────────────────┘
그림 23.1 에이전트와 웹 브라우저의 상호작용
앤스로픽의 Computer Use
이 기능은 앤스로픽의 AI 모델인 클로드(Claude)가 사람처럼 컴퓨터 데스크톱 환경을 직접 다룰 수 있게 합니다. 클로드는 스크린샷으로 화면을 인식하고 마우스와 키보드를 프로그래밍 방식으로 제어해, 서로 연결되지 않은 여러 애플리케이션을 아우르는 워크플로를 오케스트레이션할 수 있습니다. 예를 들어 PDF 보고서의 데이터를 분석하고, 스프레드시트 애플리케이션을 열어 그 데이터로 계산하고, 차트를 만든 뒤 이메일 초안에 붙여 넣으라고 요청할 수 있습니다. 이런 일련의 작업은 이전까지는 사람이 계속 개입해야 가능했습니다.
Browser Use
Browser Use는 브라우저 자동화를 프로그래밍 방식으로 수행할 수 있게 해 주는 오픈소스 라이브러리로, 고수준 API를 제공합니다. 이를 통해 AI 에이전트는 문서 객체 모델(DOM) 에 접근하고 제어하면서 웹페이지와 상호작용할 수 있습니다. 이 API는 브라우저 제어 프로토콜의 복잡한 저수준 명령을 더 단순하고 직관적인 함수 집합으로 추상화합니다. 그 결과 에이전트는 중첩된 요소에서 데이터를 추출하고, 양식을 제출하고, 여러 페이지를 자동으로 탐색하는 등 복잡한 작업 순서를 수행할 수 있습니다. 구조화되지 않은 웹 데이터를 구조화된 형식으로 손쉽게 바꿀 수 있고, 에이전트는 이렇게 변환된 데이터를 체계적으로 처리해 분석이나 의사결정에 활용할 수 있습니다.
네 가지를 나란히 놓으면 무엇을 “보는가” 에서 차이가 납니다.
| 프로젝트 | 만든 곳 | 동작 범위 | 화면을 읽는 방식 |
|---|---|---|---|
| ChatGPT Operator | 오픈AI | 데스크톱의 여러 애플리케이션 | 화면 요소 시각 인식 |
| Project Mariner | 구글 | 크롬 브라우저 안 | 화면 요소 시각 인식 |
| Computer Use | 앤스로픽 | 데스크톱 전체, 앱 간 워크플로 | 스크린샷 + 마우스·키보드 제어 |
| Browser Use | 오픈소스 | 웹페이지 | DOM 직접 접근 |
Browser Use만 성격이 다릅니다. 앞의 셋은 픽셀을 보고 판단하지만, Browser Use는 웹페이지의 구조(DOM)를 읽습니다. 버튼이 어떻게 생겼는지 추론할 필요 없이 <button> 태그를 바로 찾을 수 있으니 더 빠르고 정확한 대신, 웹 밖으로는 나가지 못합니다. 시각 기반 방식은 느리고 오인식 위험이 있지만 화면에 보이는 것이라면 무엇이든 다룰 수 있습니다.
상호작용: 에이전트와 환경
컴퓨터 화면이라는 제한된 공간을 넘어, AI 에이전트는 점점 더 복잡하고 역동적인 환경과 상호작용하도록 설계되고 있습니다. 이런 환경은 현실 세계를 그대로 반영하는 경우가 많고, 이를 위해서는 정교한 인식, 추론, 구동 능력이 필요합니다.
구글 Project Astra
에이전트가 환경과 상호작용하는 범위를 넓히는 대표적 사례입니다. Astra는 일상생활에 도움이 되는 범용 AI 에이전트를 목표로 하며, 시각·소리·음성 같은 멀티모달 입력과 그에 대응하는 출력을 활용해 주변 세계를 맥락에 맞게 이해하고 상호작용합니다. 빠른 이해, 추론, 응답에 초점을 맞추고 있으며, 에이전트가 카메라와 마이크를 통해 주변을 “보고” “듣고” 자연스럽게 대화하면서 실시간으로 도움을 주게 합니다.
Astra가 그리는 비전은 관찰한 환경을 이해해 잃어버린 물건을 찾는 일부터 코드 디버깅까지 다양한 작업을 매끄럽게 돕는 에이전트다. 이는 단순한 음성 명령을 넘어, 사용자가 처한 즉각적인 물리적 맥락을 체화된 수준에서 이해하는 방향으로 나아간다.
구글 Gemini Live
기존 AI 상호작용을 더 유연하고 역동적인 대화로 바꿔 놓습니다. 사용자는 AI에게 말을 걸 수 있고, AI는 지연이 거의 없는 자연스러운 음성으로 응답합니다. 대화 도중 말을 끊거나 주제를 바꿀 수도 있는데, 그러면 AI는 즉시 거기에 맞춰 적응합니다. 음성에만 머물지 않고 휴대폰 카메라로 대상을 보여 주거나, 화면을 공유하거나, 파일을 업로드해 시각 정보를 대화에 포함할 수 있어 더 맥락에 맞는 상호작용이 가능합니다. 더 발전한 버전은 사용자의 목소리 톤까지 파악하고, 관련 없는 배경 소음을 지능적으로 걸러 내어 대화를 더 잘 이해합니다. 사용자가 카메라로 대상을 비추기만 해도 해당 작업에 대한 안내를 실시간으로 받는 식의 풍부한 상호작용이 가능해집니다.
오픈AI GPT-4o
“omni” 상호작용을 위해 설계된 또 다른 선택지로, 음성·비전·텍스트 전반을 아우르며 추론할 수 있습니다. 사람의 반응 속도에 가까운 낮은 지연으로 입력을 처리하므로 실시간 대화가 가능합니다. 예를 들어 사용자는 실시간 비디오 피드를 보여 주며 지금 무슨 일이 일어나고 있는지 물을 수 있고, 언어 번역에도 활용할 수 있습니다. 오픈AI는 개발자가 낮은 지연의 음성 대 음성 상호작용이 필요한 애플리케이션을 만들 수 있도록 Realtime API도 제공합니다.
오픈AI ChatGPT Agent
이전 세대보다 한층 발전한 아키텍처로, 여러 새로운 기능을 하나의 프레임워크에 통합했습니다.
- 현재 시점의 데이터를 추출하기 위해 실시간으로 업데이트되는 웹을 자율적으로 탐색하는 능력
- 데이터 분석 같은 작업에 필요한 계산 코드를 그때그때 생성하고 실행하는 능력
- 제3자 소프트웨어 애플리케이션과 직접 연동하는 기능
이러한 기능이 결합되면 사용자의 단일 지시만으로도 복잡한 순차 워크플로를 오케스트레이션해 끝까지 수행할 수 있습니다. 시장 분석을 수행하고 그 결과에 맞는 프레젠테이션을 만들거나, 여러 실무 준비를 계획하고 필요한 거래를 실행하는 등 전체 프로세스를 자율적으로 관리합니다.
눈여겨볼 부분은 안전 설계입니다. 오픈AI는 이 시스템을 공개하면서 동시에 이런 시스템에 내재된 새로운 안전 문제에도 선제적으로 대응했습니다. 함께 공개된 “시스템 카드” 는 온라인에서 작업을 수행하는 AI가 지닌 잠재적 운영 위험을 상세히 밝히며, 새롭게 생겨나는 오용 경로를 짚어 냅니다.
| 안전장치 | 연결되는 패턴 |
|---|---|
| 특정 유형의 작업에 대해 명시적으로 사용자 승인을 받도록 함 | 13장 휴먼 인 더 루프 |
| 강력한 콘텐츠 필터링 체계 | 18장 가드레일/안전 패턴 |
| 초기 사용자 집단의 피드백을 반영하는 반복적 개선 | 19장 평가와 모니터링 |
화면을 클릭하고 거래를 실행할 수 있는 에이전트는 잘못 동작했을 때 되돌리기 어려운 행동을 할 수 있습니다. 앞선 장에서 개별 패턴으로 배운 안전장치들이 실제 제품에서는 한 묶음으로 적용된다는 것을 보여 주는 사례입니다.
마이크로소프트 Seeing AI
시각장애인과 저시력 사용자가 주변 상황을 실시간 음성으로 안내받을 수 있게 하는 무료 모바일 애플리케이션입니다. 기기의 카메라와 인공지능을 활용해 사물, 텍스트, 사람 등을 식별하고 설명합니다. 핵심 기능으로는 문서 읽기, 화폐 인식, 바코드를 통한 제품 식별, 장면과 색상 설명이 있습니다. 시각 정보에 대한 접근을 넓혀 시각장애 사용자의 자립성을 높이는 데 도움을 줍니다.
앤스로픽 클로드 4 시리즈
고급 추론과 분석 역량을 갖춘 또 다른 선택지입니다. 본래는 텍스트 중심 모델이었지만, 클로드 4는 탄탄한 비전 역량도 갖추고 있어 이미지, 차트, 문서의 정보를 처리합니다. 복잡한 다단계 작업을 맡기거나 상세한 분석을 받아 보기에 적합합니다. 실시간 대화 기능을 다른 모델만큼 전면에 내세우지는 않지만, 그 바탕이 되는 지능은 매우 유능한 AI 에이전트를 구축할 수 있도록 설계되어 있습니다.
| 시스템 | 입력 | 강조점 |
|---|---|---|
| Project Astra | 카메라·마이크 (시각·소리·음성) | 물리적 맥락의 체화된 이해, 범용 일상 도우미 |
| Gemini Live | 음성 + 카메라·화면 공유·파일 | 끊고 끼어들 수 있는 저지연 대화, 톤·소음 처리 |
| GPT-4o | 음성·비전·텍스트 | 사람에 가까운 반응 속도, Realtime API |
| ChatGPT Agent | 웹·코드 실행·외부 앱 | 단일 지시로 끝까지 가는 자율 워크플로, 안전장치 |
| Seeing AI | 모바일 카메라 | 접근성 — 사물·텍스트·화폐·바코드·장면 설명 |
| 클로드 4 | 텍스트 + 이미지·차트·문서 | 고급 추론, 다단계 작업과 상세 분석 |
바이브 코딩: AI와 함께하는 직관적 개발
GUI와 물리 세계와 직접 상호작용하는 방식을 넘어, 개발자가 AI와 함께 소프트웨어를 만드는 방식에서도 “바이브 코딩(vibe coding)” 이라는 새로운 패러다임이 떠오르고 있습니다. 이 접근법은 정밀한 단계별 지시에서 벗어나, 개발자와 AI 코딩 도우미가 더 직관적이고 대화하듯 주고받으며 반복적으로 상호작용하는 방식에 기댑니다. 개발자는 상위 수준의 목표, 원하는 “바이브”, 또는 대략적인 방향을 제시하고, AI는 이에 맞춰 코드를 생성합니다.
| 특징 | 내용 |
|---|---|
| 대화형 프롬프트 | 상세 명세를 일일이 작성하는 대신 “새 앱용으로 단순하고 현대적인 랜딩 페이지를 만들어 줘”, “이 함수를 더 파이썬답고 읽기 쉽게 리팩터링해 줘”라고 말한다. AI는 “modern”이나 “Pythonic”이 뜻하는 “바이브”를 해석해 그에 맞는 코드를 생성한다 |
| 반복적 개선 | AI의 첫 결과물은 대개 출발점일 뿐이다. “좋은 시작이야. 그런데 버튼을 파란색으로 바꿔 줄래?”, “여기에 예외 처리를 조금 추가해 줘”처럼 자연어로 피드백을 주고, 이 주고받기는 코드가 기대에 맞을 때까지 이어진다 |
| 창의적 파트너십 | AI는 개발자가 미처 떠올리지 못한 아이디어와 해결책을 제안하는 창의적 파트너 역할을 한다. 개발 속도가 빨라지고 더 혁신적인 결과로 이어질 수 있다 |
| “어떻게”보다 “무엇”에 집중 | 개발자는 원하는 결과, 곧 “무엇”에 집중하고 구현 세부사항인 “어떻게”는 AI에게 맡긴다. 상용구 코드에 발목 잡히지 않고 빠르게 프로토타입을 만들고 다양한 접근을 탐색할 수 있다 |
| 선택적 기억 저장소 | 상호작용이 길어져도 맥락을 유지하려면 핵심 정보와 선호, 제약을 저장하는 “기억 저장소”를 활용한다. 특정 코딩 스타일이나 프로젝트 요구사항을 AI의 기억에 저장해 두면, 같은 지시를 반복하지 않아도 이후 생성되는 코드가 이미 정해 둔 “바이브”와 일관되게 유지된다 |
바이브 코딩은 GPT-4, 클로드, 제미나이 같은 강력한 AI 모델이 개발 환경에 통합되면서 점점 더 널리 퍼지고 있습니다. 이런 도구는 단순히 코드를 자동 완성하는 데 그치지 않고, 소프트웨어 개발의 창의적 과정에 적극적으로 참여해 개발을 더 쉽게 하고 효율도 높입니다.
이러한 새로운 작업 방식은 소프트웨어 엔지니어링의 성격 자체를 바꾸며, 문법과 API를 기계적으로 외우는 일보다 창의성과 상위 수준의 사고를 더 중시하게 만든다.
표의 다섯 특징은 모두 앞 장들의 패턴과 짝을 이룹니다. 대화형 프롬프트와 반복적 개선은 22장의 반복적 프롬프팅을 사람과 AI가 실시간으로 주고받는 형태이고, 선택적 기억 저장소는 8장의 장기 기억입니다. 다만 22장이 강조한 원칙 — 명확성과 구체성, 자동화된 테스트와 평가 — 을 떠올리면 한계도 보입니다. “바이브”는 본질적으로 모호한 지시이고, 모호한 지시에서 나온 코드는 결국 누군가 검증해야 합니다. “어떻게”를 AI에게 맡길수록 “제대로 됐는가”를 판단하는 몫은 더 무거워집니다.
핵심 정리
- AI 에이전트는 단순 자동화를 넘어, 사람처럼 그래픽 사용자 인터페이스를 시각적으로 제어하며 소프트웨어를 다루는 방향으로 발전하고 있다.
- 다음 영역은 현실 세계와의 상호작용이다. 구글의 Astra 같은 프로젝트는 카메라와 마이크를 활용해 주변의 물리적 환경을 보고, 듣고, 이해한다.
- 선도 기술 기업들은 이러한 디지털 능력과 물리적 능력을 하나로 모아, 두 영역을 오가며 끊김 없이 동작하는 범용 AI 도우미를 만들고 있다.
- 이러한 전환은 새로운 부류의 AI 동반자를 만들어 내고 있다. 이들은 주도적이고 맥락을 이해하며, 사용자의 일상에서 매우 다양한 작업을 돕는다.
마치며
에이전트는 기본 자동화에서 벗어나 디지털 환경과 물리 환경 모두와 정교하게 상호작용하는 방향으로 크게 발전하고 있습니다. 시각 인식을 활용해 그래픽 사용자 인터페이스를 다루며, 기존 API에 의존하지 않고도 사람처럼 소프트웨어를 조작할 수 있습니다. 주요 기술 연구소들은 복잡한 다중 애플리케이션 워크플로를 사용자의 데스크톱에서 직접 자동화할 수 있는 에이전트를 선보이며 이 분야를 개척하고 있습니다. 동시에 다음 개척 영역은 물리 세계로 넓어지고 있으며, Project Astra 같은 시도는 카메라와 마이크를 활용해 주변 환경과 맥락에 맞게 상호작용합니다. 이러한 고급 시스템은 인간의 상호작용을 닮은 멀티모달 실시간 이해를 목표로 설계되고 있습니다.
궁극의 지향점은 디지털 능력과 물리적 능력이 하나로 수렴해, 사용자가 처한 모든 환경에서 매끄럽게 동작하는 범용 AI 도우미를 만드는 데 있다.
소프트웨어 제작 방식 자체도 바뀌고 있습니다. 개발자와 AI가 더 직관적으로 대화하며 함께 만드는 협업 방식, 곧 “바이브 코딩”이 등장한 것입니다. 이 새로운 방법은 구현 세부사항보다 상위 수준의 목표와 창의적 의도를 우선하며, 개발자가 원하는 결과에 더 집중할 수 있게 합니다. 이 모든 흐름은 결국 우리 일상에서 매우 다양한 작업을 도울 수 있는 주도적이고 맥락을 이해하는 새로운 AI 동반자의 시대로 이어집니다.
이 장이 소개한 제품 이름들은 몇 달이면 바뀝니다. 오래 남는 것은 그 아래의 구조입니다. 보고(인식) → 해석하고(LLM 추론) → 움직이고(구동) → 결과를 다시 보는 루프, 그리고 그 루프가 되돌리기 어려운 행동을 할 때 끼워 넣는 승인과 필터입니다. 대상이 API든 화면이든 현실 공간이든, 에이전트의 뼈대는 이 책이 22개 장에 걸쳐 쌓아 온 그 패턴들 그대로입니다.