Ox Alpha, ‘코딩 80%’ 소문의 진실…전체 실험은 58.4%

100만 토큰과 무료 제공으로 주목받은 익명 모델 Ox Alpha를 공식 사양, DeepSWE 113개 전체 실행, LiveCodeBench, 데이터 약관으로 다시 봤다. 정체 추정보다 먼저 확인할 실전 한계가 있다.

읽는 시간 약 7

AI는 자료 조사와 초안 정리에 보조적으로 사용했으며, 편집부가 출처와 사실을 확인했습니다.

Ox Alpha의 긴 컨텍스트와 도구 호출 한계를 표현한 편집 이미지

Ox Alpha가 지난 주말 개발자 커뮤니티를 휩쓸었다. 만든 회사는 숨겨져 있는데 컨텍스트는 100만 토큰이고 코딩 에이전트 작업에 강하며 당장은 무료라는 모델이다. 거기에 DeepSWE 80%라는 숫자가 붙었다. 차세대 코딩 모델이 나타났다는 반응이 나올 만했다.

하지만 처음 퍼진 80%는 전체 벤치마크가 아니었다. 10개 과제 중 8개를 푼 초기 실행이었다. 이후 113개 과제를 모두 돌리고 로그까지 공개한 별도 실험의 해결률은 58.4%였다. 숫자가 내려갔다고 Ox Alpha를 시시한 모델로 볼 일은 아니다. 오히려 두 결과의 간격에서 이 모델을 어디까지 믿어도 되는지가 선명해진다.

내 판단은 이렇다. Ox Alpha는 구현력이 좋은 실험용 작업자다. 계획부터 검수까지 혼자 맡길 선임 개발자는 아직 아니다. 공짜 토큰보다 사람이 뒤에서 확인할 시간과 데이터 조건을 먼저 계산해야 한다.

확인된 이름은 모델명보다 프리뷰 코드명에 가깝다

OpenRouter 공식 모델 페이지는 Ox Alpha를 익명 제3자가 개발·운영하는 스텔스 모델이라고 밝힌다. OpenRouter는 개발사도 소유자도 아니다. 요청을 전달하는 관문이다. 여러 모델을 한 API로 연결하는 구조는 앞서 쓴 OpenRouter 인수 기사에 정리해 뒀다.

사양은 꽤 구체적이다. 컨텍스트 1,048,576토큰, 최대 출력 131,072토큰이다. 텍스트와 이미지, 영상을 받아 결과는 텍스트로 나온다. 도구 호출과 JSON 응답도 된다. 추론은 끌 수 없고 기본 강도는 max다. 조절값은 low, high, max 세 단계다. 2026-08-24 현재 OpenRouter의 입력·출력 가격은 모두 0이다.

공개된 쪽만큼 빈칸도 크다. 개발사, 정확한 기반 모델, 파라미터 수, 학습 방식, 공개 가중치, 라이선스, 지식 기준일은 알 수 없다. OpenRouter는 출시일을 2026-08-20으로 표시한다. OpenCode 문서Ox Alpha Free를 한시 제공 모델로 올려놓았다. 지금의 무료 가격을 정식 출시 뒤 가격이나 장기 제공 약속으로 받아들이면 곤란하다.

‘80%’는 10개 과제에서 시작됐다

화제의 출발점은 Ben Davis가 공유한 DeepSWE 초기 실행이다. Ox Alpha는 10개 과제 중 8개를 해결했다. 10개짜리 시험은 한 문제만 달라져도 점수가 10%포인트 움직인다. 함께 놓인 비교 모델과 실행 횟수도 달랐다. 눈길을 끄는 신호인 건 맞지만 코딩 모델 순위가 뒤집혔다고 보기에는 얇은 근거다.

며칠 뒤 MatchaOnMuffins가 113개 전체 과제 실행 코드와 로그를 내놨다. pier 0.3.1과 mini-swe-agent, Docker 환경에서 20시간 39분 동안 돌린 결과는 66/113, 58.4%였다. 초기 8/10과 조건이 같은 재실험은 아니다. 둘의 차이를 성능 하락으로 읽을 수는 없다. 작은 표본에서 받은 인상이 전체 실행에서 얼마나 달라지는지 보여준 사례다.

전체 실험의 약점은 코딩 지식보다 마무리였다

58.4%라는 표면 점수만 보면 평범할 수 있다. 로그를 뜯어보면 인상이 달라진다. 113개 가운데 90개 과제가 요구 테스트의 90% 이상을 통과했다. 완전히 풀지 못한 작업도 상당수는 답 바로 앞까지 갔다.

문제는 에이전트 루프를 닫는 구간이었다. 11개 과제는 모델이 도구 호출을 연달아 내놓지 않아 RepeatedFormatError로 끝났다. 전체의 9.7%다. 5개 과제는 90분 제한을 넘겼다. 기능을 거의 만들고도 기존 테스트를 깨거나 종료 형식을 지키지 못한 사례도 있었다.

Ox Alpha의 추론 능력과 에이전트 신뢰성은 따로 봐야 한다. 코드를 떠올리는 힘은 최종 해결률보다 나아 보인다. 반면 도구를 제때 부르고 작업을 끝까지 닫는 능력은 무인 운영에 모자란다. 실제 저장소 평가에서 단일 점수만큼 실패 유형이 중요한 이유다. 현재 모델별 지표는 코딩 AI 벤치마크 페이지에서 따로 비교할 수 있다.

도구를 빼자 28.0%라는 다른 얼굴이 나왔다

xnasarx의 LiveCodeBench release_v6 실험에서는 175개 문제 가운데 49개를 풀어 pass@1 28.0%를 기록했다. temperature 0, 문제당 한 번, 에이전트와 도구 없이 Python 답변만 낸 조건이다. Easy는 51.2%였고 Hard는 13.8%였다.

DeepSWE의 58.4%와 어느 쪽이 진짜 점수냐는 질문에는 답이 없다. 하나는 저장소에서 도구를 쓰는 장기 작업이고 다른 하나는 알고리즘 문제에 코드를 바로 답하는 시험이다. 프롬프트와 채점법도 다르다. 두 결과를 겹쳐 보면 Ox Alpha가 순수 코드 생성기보다는 에이전트 환경의 긴 작업에서 힘을 내는 모델이라는 가설은 세울 수 있다. 다만 주요 모델을 같은 조건에서 비교한 자료가 없어 순위를 굳힐 단계는 아니다.

GLM 계열이라는 추정은 강하지만 확정은 아니다

커뮤니티에서는 Ox Alpha를 Z.ai의 GLM 계열로 보는 쪽이 우세하다. 모델에게 이름을 물어 얻은 답 때문은 아니다. 재현 가능한 지문 분석은 44개 문자열의 토큰 수가 GLM-5 세대 토크나이저와 44/44 일치했다고 보고했다. 중국어로 돌아오는 검열·파라미터 오류와 약 100만 토큰 입력 경계도 기록돼 있다.

GLM 계보일 가능성을 꽤 높이는 근거다. 그래도 개발사 확인서는 아니다. 공개 토크나이저는 다른 사업자도 쓸 수 있고 같은 세대 모델은 토크나이저만으로 정확한 버전을 가르기 어렵다. GLM-5.3 같은 구체적인 이름이나 Z.ai 소유라고 단정한 글은 증거보다 한발 앞서 있다. 모델의 자기소개 역시 신분증이 될 수 없다.

무료보다 먼저 읽어야 할 데이터 조건

성능보다 더 조심할 부분은 데이터다. OpenRouter 모델 카드는 제공사가 프롬프트와 응답을 보관하지만 학습에는 쓰지 않는다고 적었다. 그런데 OpenRouter Stealth EULA는 사용자 콘텐츠가 스텔스 제공사에 공유되고 모델 학습·평가·개선에 쓰일 수 있다고 규정한다. 두 문서는 같은 방향으로 읽히지 않는다.

OpenCode의 현재 개인정보 표는 Ox Alpha Free를 학습 미사용, 보관 0일로 표시한다. 같은 모델 별칭이라도 OpenRouter와 OpenCode 중 어느 길로 접속하느냐에 따라 조건이 다르다. OpenCode의 ZDR 약속을 OpenRouter 호출까지 넓혀 해석하면 안 된다.

문서가 엇갈리는데 회사 소스코드로 정답을 확인할 이유는 없다. OpenRouter 경로에는 비공개 저장소, API 키, 고객 데이터, 개인정보를 넣지 않는 편이 안전하다. OpenCode를 택하더라도 실제 요청 경로와 그날의 약관은 다시 확인해야 한다.

지금 쓴다면 구현 작업자로만 맡기겠다

내가 지금 Ox Alpha를 시험한다면 공개 저장소나 비밀이 없는 샌드박스에서만 쓰겠다. 요구사항과 완료 조건은 사람이 먼저 정한다. 구현 뒤에는 다른 모델이나 사람이 테스트와 변경 내역을 다시 본다. 도구 호출 누락과 시간 초과는 별도 로그로 남기고 무료 프리뷰가 사라져도 일이 멈추지 않게 대체 모델을 붙여둔다.

100만 토큰 창도 저장소 전체를 한 번에 쏟아 넣으라는 초대장은 아니다. 지문 분석팀은 약 93만4천 토큰에 숨긴 값을 회수했다. 바늘 찾기와 대형 코드베이스의 의존관계를 이해하는 일은 전혀 다르다. 작은 저장소부터 수정 정확도, 기존 테스트 보존, 도구 호출 성공률을 재는 편이 낫다.

Ox Alpha가 뜨거운 데는 익명성, 무료, 100만 토큰이 한꺼번에 붙은 영향이 크다. 정체 추리보다 인상적인 장면은 80%라는 작은 실험이 며칠 만에 113개 전체 로그로 교정된 과정이었다. 지금 확인된 Ox Alpha는 유능한 구현 작업자 후보지, 자리를 비워도 되는 자율 개발자는 아니다. 개발사 이름이 공개되더라도 실제 로그가 바뀌기 전까지 이 판단은 그대로다.

참고한 출처

공식 출처와 보조 신호를 함께 확인했습니다. 전체 8개 중 공식 출처는 4개입니다.

함께 보면 좋은 글