기술 블로그

같은 GPT-6 Astra인데 62.7%와 99.9%

AI 성능을 좌우하는 에이전트 하네스

OpenAI는 2026년 9월 3일 GPT-6 Astra를 공개했습니다. 105만 토큰 컨텍스트, 컴퓨터 사용과 코드 실행을 포함한 폭넓은 도구 지원, 복잡한 장기 작업을 겨냥한 성능이 주목받았습니다.

그러나 이번 발표에서 개발자가 더 깊게 살펴봐야 할 숫자는 단순한 모델 점수가 아닙니다. 독립 평가기관 ARC Prize가 같은 모델을 같은 ARC-AGI-3 과제에 적용했을 때, 실행 방식에 따라 최고 점수가 62.7%와 99.9%로 크게 달라졌습니다.

이 차이는 “어떤 모델을 선택했는가?”만으로 AI 시스템의 성능을 설명할 수 없다는 사실을 보여줍니다. 모델을 둘러싼 에이전트 하네스(agent harness), 즉 도구·메모리·컨텍스트·재시도·실행 환경을 조율하는 소프트웨어가 모델 자체만큼 중요해진 것입니다.

이 글은 2026년 9월 3일 공개된 OpenAI 자료와 ARC Prize·Artificial Analysis의 독립 평가를 바탕으로 작성했습니다. 벤치마크 결과는 평가 버전과 실행 조건에 따라 달라질 수 있습니다.


1. GPT-6 Astra의 개발자 관점 핵심 사양

OpenAI API 문서가 공개한 주요 사양은 다음과 같습니다.

항목 내용
컨텍스트 창 1,050,000 토큰
최대 출력 128,000 토큰
지식 기준일 2026년 4월 30일
추론 강도 low, medium, high, xhigh, max
입력 가격 100만 토큰당 10달러
캐시 입력 가격 100만 토큰당 1달러
출력 가격 100만 토큰당 50달러
주요 도구 웹 검색, 파일 검색, 코드 인터프리터, 호스티드 셸, 패치 적용, 컴퓨터 사용, MCP
파인튜닝 지원하지 않음

27만 2천 토큰을 넘는 긴 입력에는 더 높은 요율이 적용됩니다. 따라서 105만 토큰을 넣을 수 있다는 사실과 그렇게 넣는 것이 경제적이라는 판단은 별개입니다.

Astra는 단순 질의응답보다 다음과 같은 끝까지 수행해야 하는 작업에 초점을 둡니다.

  • 여러 파일과 문서를 함께 분석하는 장기 프로젝트
  • 코드 수정, 테스트, 오류 수정이 반복되는 소프트웨어 작업
  • 브라우저나 데스크톱을 조작하는 컴퓨터 사용
  • 외부 도구와 데이터를 연결하는 연구·분석
  • 계획을 세우고 중간 결과를 보존하며 진행하는 에이전트 업무

이런 작업에서는 모델의 한 번의 답변보다 실행 과정 전체를 관리하는 구조가 성능을 좌우합니다.


2. 에이전트 하네스란 무엇인가?

하네스는 모델을 실제 작업 시스템으로 바꾸는 실행 계층입니다. 자동차의 엔진이 모델이라면, 하네스는 변속기·계기판·제동 장치·내비게이션을 포함한 운전 시스템에 가깝습니다.

사용자 목표
    ↓
작업 계획과 권한 정책
    ↓
모델 추론
    ↓
도구 선택·호출
    ↓
결과 관찰과 상태 저장
    ↓
컨텍스트 압축·재계획
    ↓
검증 후 완료 또는 사람에게 질문

대표적인 구성 요소는 다음과 같습니다.

구성 요소 역할
컨텍스트 관리자 필요한 정보만 선택하고 긴 기록을 압축
상태 저장소 세션이 길어져도 결정·진행 상황·산출물을 보존
도구 라우터 검색, 코드 실행, 파일 수정 등 적절한 도구를 선택
실행 샌드박스 코드와 명령을 격리된 환경에서 안전하게 실행
검증기 테스트·정적 분석·규칙으로 결과를 확인
재시도 정책 실패 원인을 구분하고 무한 반복을 방지
권한 계층 읽기, 쓰기, 외부 전송, 배포 권한을 단계별로 통제
관측 시스템 비용, 지연, 도구 호출, 오류와 변경 이력을 기록

같은 모델이라도 이 계층이 어떻게 설계됐는지에 따라 문제 해결 능력, 비용, 속도, 안전성이 모두 달라질 수 있습니다.


3. 62.7%와 99.9%는 왜 달랐나?

ARC-AGI-3는 정답 규칙이 설명되지 않은 새로운 상호작용 환경에서 에이전트가 탐색하고 규칙을 발견해 목표를 달성하는지 평가합니다. 단순 지식 회상이 아니라 낯선 환경에서 상태를 이해하고 계획을 수정하는 능력을 측정합니다.

ARC Prize는 GPT-6 Astra를 두 방식으로 평가했습니다.

평가 방식 최고 점수 조건
Standard harness 62.7% 모델이 직접 선택한 가시적 메모를 다음 단계로 전달
Provider Adapter harness 99.9% 제공자 전용 추론 상태 보존과 컨텍스트 압축 사용

Provider Adapter는 요청 사이에 외부에서 볼 수 없는 추론 상태를 유지하고, 긴 대화를 압축해 이전 작업을 계속 활용할 수 있게 했습니다. 두 하네스가 공통으로 해결한 167개 게임-추론 조합을 비교했을 때 Provider Adapter 실행은 기록된 총 경과 시간 기준 약 3.66배 빨랐고, 전체 토큰도 49% 적게 사용했습니다.

즉 점수 차이는 모델 가중치가 달라서 생긴 것이 아닙니다. 모델이 이미 알아낸 규칙과 계획을 얼마나 잘 보존하고 다시 사용할 수 있었는지가 달랐습니다.

Standard harness가 묻는 질문

모든 모델에 같은 최소 인터페이스를 제공하면 어떤 모델이 더 잘 적응하는가?

모델 간 비교에는 이 방식이 유리합니다. 제공자마다 다른 비공개 기능을 줄이고 동일한 조건을 유지하기 때문입니다.

Provider Adapter가 묻는 질문

이 모델에 최적화된 실제 제품 환경을 제공하면 어디까지 성능을 낼 수 있는가?

실제 서비스 도입에는 이 질문도 중요합니다. 사용자는 모델만 구매하는 것이 아니라 모델과 컨텍스트 관리, 도구 실행, 캐시, 오류 복구가 결합된 시스템을 사용하기 때문입니다.

두 결과 중 하나가 틀린 것이 아닙니다. 서로 다른 시스템 질문에 답하는 두 개의 유효한 결과입니다.


4. 벤치마크 숫자보다 평가 조건을 읽어야 한다

ARC Prize는 Astra의 발전을 중요한 단계 변화로 평가하면서도, 이 결과가 AGI 달성의 증거는 아니라고 명시했습니다. ARC-AGI-3는 결정론적이고 목표가 분명한 제한된 환경이며, 실제 세계의 개방성과 복잡성을 모두 대표하지 않기 때문입니다.

벤치마크를 볼 때는 최소한 다음을 함께 확인해야 합니다.

  1. 하네스: 표준 실행인지 제공자 최적화 실행인지
  2. 추론 강도: low, high, max 중 어떤 설정인지
  3. 도구: 코드 실행, 검색, 외부 메모리가 허용됐는지
  4. 상태: 요청 사이의 추론·메모리가 유지되는지
  5. 재시도: 한 번의 시도인지 여러 시도 중 최고인지
  6. 비용: 전체 평가 또는 과제당 토큰 비용이 얼마인지
  7. 버전: 모델 스냅샷과 평가 데이터·지표 버전이 무엇인지

최고 점수만 비교하면 모델의 능력과 시스템 최적화 효과를 혼동하기 쉽습니다.


5. 독립 평가는 ‘모든 업무의 압도적 향상’이 아님을 보여준다

Artificial Analysis가 9월 3일 공개한 평가에서도 분야별 결과가 달랐습니다.

코딩 에이전트에서는 효율 향상

GPT-6 Astra는 Artificial Analysis Coding Agent Index에서 67점을 기록해 Claude Opus 5·Fable 5와 비슷한 수준에 올랐습니다. 최대 추론 설정에서 GPT-5.6 Sol보다 약 2점 높았고, 출력 토큰은 약 3분의 1만 사용했습니다. 높은 토큰 단가에도 불구하고 작업당 비용은 Sol의 최대 설정과 비슷했습니다.

일반 지능 지표에서는 비용 대비 개선이 제한적

발표 직후 사용된 Intelligence Index v4.1.1에서는 Astra와 GPT-5.6 Sol이 모두 61점이었습니다. Astra가 출력 토큰을 약 10% 덜 사용했지만 API 단가 상승으로 최대 설정의 과제당 비용은 약 75% 높았습니다.

세부 평가도 한 방향으로 움직이지 않았습니다. 장기 지식 작업과 환각 감소에서는 개선됐지만, 일부 고객지원·과학 코딩·장문 추론 지표에서는 후퇴가 관찰됐습니다.

이 결과가 주는 교훈은 단순합니다.

새 모델이 더 뛰어나다는 말은 모든 업무에서 더 높은 품질과 더 낮은 비용을 보장하지 않는다.

특히 벤치마크 지표는 계속 개정됩니다. 평가 기사와 대시보드의 점수가 다르다면 날짜와 지표 버전을 먼저 확인해야 합니다.


6. 기업은 ‘모델’이 아니라 ‘모델+하네스’를 평가해야 한다

기업이 모델 교체를 검토할 때 API 호출 한 번의 정답률만 측정하면 실제 효과를 놓칠 수 있습니다. 다음 단위로 평가해야 합니다.

모델
+ 시스템 프롬프트
+ 컨텍스트 선택·압축
+ 검색·코드 실행·MCP 도구
+ 상태 저장과 재시도
+ 검증·승인·복구
= 실제 에이전트 시스템

평가 지표

영역 측정할 내용
품질 전체 작업 성공률, 사람 수정률, 재작업률
비용 성공한 작업 1건당 총 토큰·도구·인프라 비용
속도 완료까지의 실제 경과 시간, 사람 대기 시간
안정성 재시도 횟수, 중단률, 같은 입력의 결과 분산
안전성 권한 초과 시도, 승인 없는 변경, 복구 가능성
운영성 추적 가능성, 로그 완전성, 장애 원인 파악 시간

핵심 지표는 ‘요청 1회당 비용’이 아니라 성공한 업무 1건당 총비용입니다. 비싼 모델이 재시도와 사람 검토를 크게 줄이면 전체 비용이 낮아질 수 있고, 반대로 벤치마크 점수가 높아도 과도한 컨텍스트와 도구 호출을 사용하면 경제성이 나빠질 수 있습니다.


7. 실무 적용을 위한 설계 원칙

1) 컨텍스트를 무조건 크게 만들지 않는다

105만 토큰을 넣을 수 있어도 모든 자료를 한 번에 제공할 필요는 없습니다. 검색과 요약을 통해 현재 단계에 필요한 근거만 불러오고, 원문 위치를 추적할 수 있게 해야 합니다.

2) 압축 전후의 핵심 상태를 구조화한다

대화 요약만 저장하면 중요한 제약이 사라질 수 있습니다. 목표, 완료 조건, 승인 범위, 결정 이유, 수정 파일, 실패한 방법을 별도 구조로 보존해야 합니다.

3) 추론 강도를 업무 위험도에 맞춘다

단순 분류와 형식 변환에 max 추론을 사용하는 것은 낭비일 수 있습니다. 복잡한 설계, 대규모 코드 변경, 모호한 연구 문제에만 높은 추론 예산을 배정합니다.

4) 모델 스냅샷과 하네스 버전을 함께 고정한다

재현성을 확보하려면 모델 ID뿐 아니라 시스템 프롬프트, 도구 정의, 컨텍스트 압축기, 재시도 정책의 버전도 기록해야 합니다.

5) 완료 전에 외부 검증을 둔다

모델이 스스로 “완료했다”고 판단한 결과만 믿지 않습니다. 테스트, 스키마 검사, 정적 분석, 정책 엔진, 사람 승인처럼 독립된 검증 신호를 사용합니다.

6) 권한과 메모리를 분리한다

장기 기억이 필요한 것과 장기 권한이 필요한 것은 다릅니다. 상태는 보존하되 자격 증명은 짧게 발급하고, 외부 전송·배포·삭제 같은 고위험 작업은 다시 승인받게 합니다.

7) 실패와 중단을 정상 결과로 설계한다

하네스는 무한 재시도 대신 예산 한도, 시간 제한, 사람에게 질문하는 조건을 가져야 합니다. 멈출 줄 아는 시스템이 운영 가능한 시스템입니다.


8. 교육 현장에서 달라져야 할 AI 실습

AI 교육도 프롬프트 작성만으로는 충분하지 않습니다. 같은 모델을 사용하더라도 학생이 설계한 하네스에 따라 결과가 크게 달라질 수 있기 때문입니다.

실습 과제로 다음을 포함할 수 있습니다.

  • 같은 과제를 짧은 컨텍스트와 검색 기반 컨텍스트로 비교
  • 전체 기록 유지와 구조화 요약의 비용·성공률 비교
  • 도구 없이 답하는 모델과 코드 실행 도구를 가진 에이전트 비교
  • 재시도 횟수에 따른 성공률과 비용 곡선 측정
  • 권한을 최소화했을 때의 안전한 실패 설계
  • 모델·프롬프트·하네스 버전을 기록해 재현성 검증

학생은 “어떤 AI가 가장 똑똑한가?”보다 “어떤 업무에 어떤 실행 구조가 적절한가?”를 판단하는 능력을 길러야 합니다.


9. 도입 전 체크리스트

  • 실제 업무 데이터로 모델과 하네스를 함께 평가했는가?
  • 점수에 사용된 하네스, 추론 강도, 재시도 조건을 기록했는가?
  • 성공한 작업 1건당 비용과 시간을 계산했는가?
  • 컨텍스트 압축 과정에서 반드시 보존할 정보를 정의했는가?
  • 도구 출력과 외부 콘텐츠를 비신뢰 입력으로 처리하는가?
  • 모델이 수정할 수 없는 위치에 실행 로그를 남기는가?
  • 삭제·배포·외부 전송 전에 승인 절차가 있는가?
  • 모델 또는 하네스 업데이트 후 회귀 평가를 수행하는가?
  • 오류 발생 시 이전 상태로 되돌릴 수 있는가?
  • 예산과 시간 한도를 넘으면 안전하게 중단하는가?

결론

GPT-6 Astra의 출시는 모델 성능 경쟁이 새로운 단계에 들어섰음을 보여줍니다. 하지만 62.7%와 99.9%라는 결과 차이가 남긴 더 중요한 교훈은 성능이 모델 내부에만 존재하지 않는다는 사실입니다.

장기 작업에서 실제 능력은 모델, 컨텍스트 관리, 상태 보존, 도구, 검증, 권한 정책이 결합된 결과입니다. 좋은 하네스는 같은 모델로 더 높은 성공률과 더 낮은 토큰 사용량을 만들 수 있지만, 제공자 최적화 환경의 결과를 표준 조건의 모델 능력으로 오해해서는 안 됩니다.

앞으로의 AI 시스템 설계자는 모델 순위표만 읽는 사람이 아니라 평가 조건을 해석하고, 자신의 업무에 맞는 하네스를 설계하며, 품질·비용·안전을 함께 측정하는 사람이어야 합니다.


참고 자료

수치와 가격은 공개 시점 자료를 기준으로 하며 이후 변경될 수 있습니다. 실제 도입 전에는 최신 공식 문서와 자체 업무 평가를 함께 확인해야 합니다.