본문으로 건너뛰기

어그제티브 코딩에서 하네스 효과 분리: 오염 제어를 위한 개인 전용 공간

AI 자동 생성

대형 언어 모델(LLM)을 조작하는 시스템인 '해쉬'(harness)가 개발되었다. 이 해쉬는 대형 언어 모델과 함께 사용되는 도구, 프롬프트, 제어 흐름으로, 대형 언어 모델을 자율 소프트웨어 개발자로 변형시킨다. 해쉬는 각 벤더가 대형 언어 모델과 함께 사용하는 해쉬를 제공하며, 사용자는 벤더가 제공하는 해쉬와 대형 언어 모델을 사용할 경우 더 많은 작업을 해결할 수 있다고 가정한다. 이 가정을 검증하기 위해 256개의 저장소와 80개의 작업을 포함하는 개인용, 오염제어된 테스트 세트를 사용하였다. 이 테스트 세트는 claude-agent-sdk와 deepagents를 사용한 claude-opus-4-8, openai-codex SDK와 deepagents를 사용한 gpt-5.5, gemini-3.5-flash, deepseek-v3.2를 포함하는 여러 해쉬를 사용하였다. 792개의 800개의 계획된 실행 결과를 고립된 오라클이 평가하였으며, 해쉬 간의 비교 결과 어느 해쉬도 평균적인 유리한 결과를 나타내지 못하였다. Opus 4.8의 경우 -1.25%p, GPT-5.5의 경우 +1.25%p의 결과를 나타내었다. Opus 4.8의 경우 저장소 작업에서 native 해쉬가 9.0%p로 뒤처졌으며, 경쟁 작업에서 23.7%p로 앞서고 있었다. 이 결과는 label-permutation p = 0.003의 유의수준을 나타내었다. 또한 정확도와 완료도도 해쉬 간에 차이를 나타내었다. 81개의 실행 중 22개의 실행이 wall-clock ceiling에서 취소되었으며, 패치가 통과된 결과를 나타내었다. 사용량에 대한 비용은 해쉬 간에 차이를 나타내었다. Opus 4.8의 경우 neutral 해쉬가 1.3에서 1.6배 더 비용이 들었으며, GPT-5.5의 경우 1.2배 더 비용이 들었다. 이러한 비용은 관찰된 사용량에 기반한 추정이며, Anthropic 계정의 58개의 실행은 사용량 기록이 없으며, 이 비용을 어느 해쉬에 할당하더라도 Opus 비율은 0.7에서 2.3 사이로 움직일 수 있다. 따라서 이 연구는 이전 연구에서 사용된 사용량-semantics 오류를 수정하고, orchestrator, grading oracle, 재분석 코드 및 유도된-aggregates를 공개하였다. 작업은 여전히 개인용으로 유지된다.

원문 보기 arXiv AI

함께 읽으면 좋은 기사

에이전트 16시간 전

Meta의 영감은 OpenAI와 Anthropic에서 본격적으로 빛나는 AI를 훔쳤습니다.

AI 리더들이 OpenAI와 Anthropic에서 "선도 경계를 맞춰가기"라는 주제로 논의를 시작했을 때, 누군가는 "어느 속도로?"라는 질문을 해야 했을 수도 있었다. 이제는 두 회사가 모두 모델을 출시하는 모델 출시 주간이 되었는데, Anthropic이 Opus 5.5을 출시한 후 OpenAI가 GPT-6 모델 업데이트를 90분만에 출시했다. 그러나 스포트라이트를 잡은 것은 Meta 였는

에이전트 2일 전

강화 학습 기반 역할 놀이 에이전트의 역할 학습을 위한 적대적 폐쇄 루프 교육과정

역할 연기하는 agent는 대규모 언어 모델을 기반으로 한 것들이 개인화된 지원 및 사회 시뮬레이션과 같은 분야에서 광범위하게 적용되어 왔다. 최근 RL 방법들은 학습이 시작되기 전에 미리 수집한 고정된 시나리오 풀에서 훈련을 받는다. 이로 인해 분포적 병목 현상이 발생한다: agent가 향상될수록 agent가 나쁜 성능을 보이는 시나리오도 변하고, 훈련 분포는 정적이다. 따라서, 우리는 역

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.