본문으로 건너뛰기

CAX-Agent: 경량 에이전트 하네스, MAPDL 자동화에 대한 신뢰성 가이드

대규모 언어 모델(LLM) 기반 MAPDL 유한 요소 시뮬레이션에서 경량 에이전트 하네스(CAX-Agent)가 제시된 연구는, 도메인별 실행 제어, 도구 캡슐화, 오류 회복 등이 구조화되지 않은 경우 출력이 일관되지 않고 작업 실패가 빈번하다는 문제를 해결하기 위해 도입되었다. 이 연구에서는 CAX-Agent의 아키텍처를 제시하고, 오류 회복 정책의 핵심 성분을 경험적으로 평가한다.

AI 자동 생성

CAX-Agent: 경량 에이전트 하네스

CAX-Agent는 MAPDL 자동화에 최적화된 경량 에이전트 하네스이다. 이 연구에서는 CAX-Agent의 아키텍처를 제시하고, 오류 회복 정책의 핵심 성분을 경험적으로 평가한다.

아키텍처

CAX-Agent는 실행을 세 가지 계층으로 구성한다: LLM 서비스, 에이전트 하네스, 솔버 백엔드. 오류 회복 정책은 결정론적 규칙 패치, 모델 기반 재생산, 컨텍스트 enrichment, 인간 개입 등 세 가지 계층을 통해 발생한다.

실험 결과

실험에서는 50개의 표준 구조적 벤치마크에 대해 세 가지 회복 전략(no_recovery, rule_only, model_only)을 평가하였다. 두 개의 독립적인 인간 평가자에 의해 작업 완료가 평가되었으며, 강한 상관관계가 존재하였다.

  • model_only: 0.9267의 완료율, 3.59/4의 작업 점수, 9.16/10의 총 점수, 0.84의 zero-intervention율
  • rule_only: 0.7733의 완료율, 3.17/4의 작업 점수, 7.03/10의 총 점수, 0.00의 zero-intervention율
  • no_recovery: 0.6933의 완료율, 2.74/4의 작업 점수, 5.60/10의 총 점수, 0.00의 zero-intervention율

실험 결과, model_only가 가장 높은 완료율과 작업 점수를 보였다.

원문 보기 arXiv AI

함께 읽으면 좋은 기사

에이전트 19시간 전

Meta의 영감은 OpenAI와 Anthropic에서 본격적으로 빛나는 AI를 훔쳤습니다.

AI 리더들이 OpenAI와 Anthropic에서 "선도 경계를 맞춰가기"라는 주제로 논의를 시작했을 때, 누군가는 "어느 속도로?"라는 질문을 해야 했을 수도 있었다. 이제는 두 회사가 모두 모델을 출시하는 모델 출시 주간이 되었는데, Anthropic이 Opus 5.5을 출시한 후 OpenAI가 GPT-6 모델 업데이트를 90분만에 출시했다. 그러나 스포트라이트를 잡은 것은 Meta 였는

에이전트 2일 전

강화 학습 기반 역할 놀이 에이전트의 역할 학습을 위한 적대적 폐쇄 루프 교육과정

역할 연기하는 agent는 대규모 언어 모델을 기반으로 한 것들이 개인화된 지원 및 사회 시뮬레이션과 같은 분야에서 광범위하게 적용되어 왔다. 최근 RL 방법들은 학습이 시작되기 전에 미리 수집한 고정된 시나리오 풀에서 훈련을 받는다. 이로 인해 분포적 병목 현상이 발생한다: agent가 향상될수록 agent가 나쁜 성능을 보이는 시나리오도 변하고, 훈련 분포는 정적이다. 따라서, 우리는 역

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.