본문 바로가기
기타/AI 정보 정리

AI 정보 정리 (2026.09.13) - 대답하는 AI에서 일을 맡는 AI로

by 라이티아 2026. 9. 13.

AI 관련 소식은 조금만 안 봐도 새로운 모델과 서비스가 쌓인다. 이름만 외워서는 뭐가 달라졌는지 알기 어려워, 최근 발표 중 개발과 실제 사용에 연결되는 내용을 정리해본다.

1. Cursor Projects - 코드 한 조각보다 프로젝트 단위의 작업

Cursor는 9월 10일 Projects를 발표했다. 기능 개발, 마이그레이션, 앱 제작처럼 한 번의 대화로 끝나기 어려운 작업을 계속 이어가는 기능이다.

구조가 흥미롭다. 사용자는 조정 역할을 하는 coordinator agent와 대화하고, 이 에이전트가 실제 구현을 맡는 다른 에이전트들에게 일을 나눠준다. 프로젝트는 클라우드 컴퓨터에서 돌아가며, 조사한 내용과 테스트 방법 등을 공유 파일로 남긴다. Slack이나 PR을 지켜보거나 정해진 일정에 따라 반복 작업을 수행하는 기능도 포함된다.

작업을 조사·구현·테스트로 나누는 예시.

Cursor는 수개월 동안 맥락을 유지하고 수천 개의 하위 에이전트에 작업을 위임할 수 있다고 설명한다. 출시 시점에는 베타로 순차 제공된다.

이제는 프롬프트 한 번을 잘 쓰는 것뿐 아니라, 작업을 어떤 단위로 나누고 어떤 테스트를 통과해야 완료로 볼지 정하는 일이 중요해진다. 유니티 프로젝트라면 우선 에디터 유틸리티나 테스트가 있는 작은 모듈처럼 결과를 확인하기 쉬운 작업부터 적용해볼 만하다.

출처: Cursor - Introducing Projects (9월 10일)

2. OpenAI Agents API - 에이전트의 실행 기반도 서비스로

OpenAI는 9월 10일 Agents API를 공개 베타로 출시했다. 모델에 질문을 보내고 답을 받는 수준을 넘어, 작업을 이어가는 에이전트를 애플리케이션에 붙이는 API다.

공식 문서에 따르면 세션 관리, 작업 조정, 길어진 문맥의 압축, 작업 복구 등을 OpenAI가 맡는다. 에이전트는 샌드박스에서 코드를 실행하거나 파일을 수정하고, 외부 도구와 MCP 서버에 연결할 수 있다. OpenAI가 제공하는 실행 환경을 쓰거나 자체 인프라의 샌드박스를 연결하는 방식도 지원한다.

작업 요청과 실행 결과가 오가는 구조.

여기서 하네스(harness)는 모델이 실제 일을 하도록 감싸는 실행 기반 정도로 이해하면 된다. 도구 실행, 작업 상태 유지, 중단 후 재개 등을 담당하는 부분이다. 모델 자체와 같은 뜻은 아니다.

에이전트를 만들 때 직접 구현해야 할 기반 기능이 줄어들 수 있다. 대신 어떤 도구와 데이터에 접근하게 할지, 비용을 얼마나 허용할지, 어디서 사람의 승인을 받을지는 여전히 설계해야 한다. 사용료도 무료로 이해하면 안 된다. 모델, 도구, 호스팅된 샌드박스 사용량에 따른 요금이 적용된다.

출처: OpenAI API 변경 기록 (9월 10일), Agents API 공식 문서

3. Meta Muse - 개인용 AI도 대화 밖에서 일을 한다

Meta는 9월 8일 개인 AI 에이전트 Muse를 공개했다. 이메일이나 여행 예약 같은 일을 돕고, 장기 목표를 계획으로 나눠 진행하는 방향의 서비스다. 앱을 닫은 뒤에도 작업을 이어갈 수 있다고 설명한다.

Muse는 별도 가상 컴퓨터에서 실행되며, 사용자가 연결할 앱과 접근 범위를 선택한다. Meta는 이메일 전송이나 구매처럼 중요한 행동에는 승인을 요청하고, 별도의 Sentinel 에이전트가 인터넷으로 나가는 행동을 검사한다고 밝혔다.

현재는 미국부터 순차 제공된다.

Cursor가 개발 프로젝트를, Muse가 개인 업무를 대상으로 하지만 방향은 비슷하다. 사용자가 계속 말을 걸어야만 움직이는 도구에서, 목표와 권한을 주면 작업을 이어가는 도구로 확장되고 있다.

출처: Meta - Introducing Muse (9월 8일)

4. GPT Image 2.5 - 생성 속도와 편집 정밀도를 나누어 보기

OpenAI는 9월 8일 이미지 생성·편집 모델 GPT Image 2.5 SunburstFlare를 API에 출시했다. 공식 문서는 Sunburst를 편집 정밀도가 중요한 작업에, Flare를 빠른 일상적 이미지 생성에 맞는 모델로 설명한다.

두 모델 모두 텍스트와 이미지를 입력받아 이미지를 만들며, Image API와 Responses API의 이미지 생성 도구에서 사용할 수 있다. 기존 품질 설정에 더해 xhigh와 max 설정도 지원한다.

게임이나 앱의 시안을 만들 때는 처음 한 장을 잘 만드는 능력과 수정 지시를 정확히 반영하는 능력을 따로 볼 필요가 있다. 아이콘의 형태를 유지한 채 색상만 바꾸거나, 기존 화면의 일부만 수정하는 작업이 그 예다.

게임 에셋으로 쓰려면 같은 입력으로 캐릭터의 일관성, 수정 정확도, 생성 시간을 비교해보면 좋겠다.

출처: OpenAI API 변경 기록 (9월 8일), Sunburst 공식 문서, Flare 공식 문서

5. AlphaGenome Atlas - 챗봇 밖에서 쌓이는 AI 연구 도구

Google DeepMind는 9월 8일 AlphaGenome Atlas를 발표했다. 인간 유전체에서 가능한 약 90억 개의 단일 염기 변이가 분자 수준에서 어떤 영향을 줄지 예측한 자료를 제공하는 플랫폼이다.

핵심은 매번 모델에 물어보는 것만이 아니라, 대규모 예측을 미리 계산해 연구자가 탐색하고 활용할 수 있게 만들었다는 점이다. 학술 연구용 웹 포털과 API, Google Antigravity의 스킬을 통한 접근을 소개했다.

연구자는 이 예측 자료를 바탕으로 후속 실험에서 살펴볼 후보와 가설을 좁힐 수 있다.

이 소식은 AI 트렌드를 챗봇 성능 순위로만 보면 놓치는 부분이다. 특정 분야의 데이터를 다루는 모델과, 그 결과를 연구 도구로 제공하는 방식도 함께 발전하고 있다.

출처: Google DeepMind - AlphaGenome Atlas (9월 8일)

6. Anthropic 위협 보고서 - 자동화가 늘수록 권한도 살펴봐야 한다

Anthropic은 9월 10일 AI 악용 사례를 다룬 위협 보고서를 공개했다. 보고 대상은 발표 당일에 발생한 사건이 아니라, 2025년 12월부터 2026년 8월 사이에 탐지하고 차단한 활동이다.

회사는 사이버 공격, 감시, 여론 조작, 사기 등 여러 영역에서 Claude가 악용된 사례를 보고했다. 특히 AI가 글을 만드는 데만 쓰이는 것이 아니라, 소프트웨어를 작성하고 여러 단계의 업무를 자동화하는 데도 쓰였다는 점이 이번 글의 다른 소식들과 연결된다.

Anthropic의 자체 조사에서 나온 사례들이다.

에이전트에 저장소, 메일, 데이터베이스를 연결할수록 접근 범위와 실행 기록이 중요해진다. 편의성을 시험하더라도 처음부터 운영 데이터와 배포 권한까지 한꺼번에 주기보다는, 테스트 환경과 제한된 권한으로 시작하는 것이 좋다.

외부 행동에 승인 단계를 두는 기본 흐름.

출처: Anthropic - Detecting and countering misuse of AI: September 2026

그래서 지금 무엇을 따라가면 좋을까?

이번 소식들을 묶어서 보면, 내 해석은 모델의 답변 품질만큼 작업을 끝내는 구조가 중요해지고 있다는 것이다. 여러 도구를 연결하고, 작업 내용을 유지하고, 결과를 검증하는 부분이 제품의 주요 기능으로 등장한다.

개발 공부를 하는 입장에서는 새 서비스 이름을 전부 외우기보다 다음 항목을 기준으로 하나씩 써보는 편이 도움이 될 것 같다.

  • 작업을 작게 맡기기: 설명만 듣지 말고 테스트 작성, 문서 정리, 작은 버그 수정처럼 완료 여부를 확인할 수 있는 일을 정한다.
  • 프로젝트 맥락 남기기: 빌드 명령, 테스트 방법, 코딩 규칙, 수정하면 안 되는 부분을 문서로 정리한다.
  • 평가 기준 정하기: 코드가 실행되는지, 기존 동작을 깨뜨리지 않는지, 사람이 수정한 시간까지 포함하면 도움이 됐는지 확인한다.
  • 권한과 비용 확인하기: 읽기와 쓰기, 테스트와 운영 환경을 구분하고 장시간 실행에 따른 사용량을 살핀다.

AI가 만들어준 결과를 빠르게 받는 것과, 그 결과를 실제 프로젝트에 넣어도 되는지 판단하는 것은 다른 문제다. 새 도구를 따라가면서도 테스트와 설계의 기본기를 같이 챙겨야 하는 이유가 여기에 있다.