본문으로 건너뛰기

CreativityBench : Affordance-Based Tool Repurposing를 통해 에이전트 Creative Reasoning을 평가하기

인공지능의 창의력 연구: 도구 재활용을 통한 사물 기능 기반 도구 사용 평가 arXiv:2605.02910v2 발표 유형: 새로운 요약: 대규모 언어 모델(LLM)의 최근 발전은 추론 및 환경 상호작용과 같은 작업에서 좋은 성능을 나타냈지만 창의적 문제 해결 능력은 여전히 연구되지 않은 상태이다. 우리는 창의적 도구 사용을 통해 이 능력을 연구한다. 여기서 모델은 지식 기반에 있는 사물의 기능 및 특성에 대하여 논리적으로 사고하며, 일반적인 사용을 의존하지 않고 사물의 새로운 용도를 사용한다

AI 자동 생성

인공지능의 창의력 연구

최근 대규모 언어 모델의 발전은 추론 및 환경 상호작용과 같은 작업에서 좋은 성능을 나타냈지만, 창의적 문제 해결 능력은 여전히 연구되지 않은 상태이다. 따라서, 이 연구는 창의적 도구 사용을 통해 이 능력을 연구한다. 여기서 모델은 지식 기반에 있는 사물의 기능 및 특성에 대하여 논리적으로 사고하며, 일반적인 사용을 의존하지 않고 사물의 새로운 용도를 사용한다.

이 연구의 첫 번째 단계로, 창의성 평가 기준을 도입한다. 이를 위해 대규모 기능 지식 기반을 구축하며, 이 지식 기반을 사용하여 기반된 작업을 생성한다. 이 작업은 제약 조건 하에서 물리적으로 가능하지만 정의되지 않은 해결책을 식별하는 것을 요구한다.

평가 결과

10개의 최신 모델을 포함하여 평가를 수행한 결과, 모델은 종종 합리적인 사물을 선택할 수 있지만, 올바른 부분, 기능 및 물리적 메커니즘을 식별할 수 없어서 성능이 크게 떨어진다. 또한, 모델 크기 향상에서 성능 향상은 빠르게 포화되며, 강력한 일반 추론은 창의적 기능 발견에 신뢰할 수 없으며, 생각의 연쇄와 같은 추론 시간 전략은 제한된 이익을 제공한다.

이러한 결과는 현재 모델에서 창의적 도구 사용이 큰 도전임을 나타내며, 이 시험은 계획 및 추론 모듈을 포함한 미래 에이전트에 대한 이 미완성된 지능의 연구를 위한 유용한 시험베드로 제공한다.

원문 보기 arXiv AI

함께 읽으면 좋은 기사

에이전트 18시간 전

Meta의 영감은 OpenAI와 Anthropic에서 본격적으로 빛나는 AI를 훔쳤습니다.

AI 리더들이 OpenAI와 Anthropic에서 "선도 경계를 맞춰가기"라는 주제로 논의를 시작했을 때, 누군가는 "어느 속도로?"라는 질문을 해야 했을 수도 있었다. 이제는 두 회사가 모두 모델을 출시하는 모델 출시 주간이 되었는데, Anthropic이 Opus 5.5을 출시한 후 OpenAI가 GPT-6 모델 업데이트를 90분만에 출시했다. 그러나 스포트라이트를 잡은 것은 Meta 였는

에이전트 2일 전

강화 학습 기반 역할 놀이 에이전트의 역할 학습을 위한 적대적 폐쇄 루프 교육과정

역할 연기하는 agent는 대규모 언어 모델을 기반으로 한 것들이 개인화된 지원 및 사회 시뮬레이션과 같은 분야에서 광범위하게 적용되어 왔다. 최근 RL 방법들은 학습이 시작되기 전에 미리 수집한 고정된 시나리오 풀에서 훈련을 받는다. 이로 인해 분포적 병목 현상이 발생한다: agent가 향상될수록 agent가 나쁜 성능을 보이는 시나리오도 변하고, 훈련 분포는 정적이다. 따라서, 우리는 역

관련 콘텐츠 더 보기

다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.