본문으로 건너뛰기

#벤치마크

333개의 기사

AI 모델 5월 8일

ZAYA1-8B: 새로운 사고를 위한 대규모 언어 모델

ZAYA1-8B은 사고를 위한 대규모 언어 모델로, 700만 개의 활성 파라미터와 8억 개의 총 파라미터를 가지고 있습니다. 이 모델은 Mathematica와 Coding에 대한 여러 도전적인 벤치마크에서 DeepSeek-R1-0528을 상회하거나 동등한 성능을 나타냈습니다. 또한, ZAYA1-8B은 더 큰 대규모 언어 모델(Gemini-2.5 Pro, DeepSeek-V3.2, GPT-5-High)과 비교했을 때도 경쟁력을 유지했습니다.

LLM PC 5월 7일

배포 관련 조정은 모델 수준 평가에서만 추출할 수 없다.

기계 학습에서 대응성 평가가 대개 모델 수준의 평가로 변해버렸습니다. 영향력 있는 벤치마크는 고정된 입력에 대한 모델 출력을 평가합니다. 예를 들어, 진실성, 지시를 따르기, 쌍별 선호도 등입니다. 이러한 점수를 종종 배포된 대응성을 지지하는 주장에 사용합니다. 이 논문은 배포 관련 대응성이 단독으로 모델 수준의 평가에서 유추될 수 없다는 것을 주장합니다. 대응성 주장은 대신에 증거가 수집되는 수준에 따라 인덱싱되어야 합니다: 모델 수준, 응답 수준, 상호 작용 수준, 또는 배포 수준. 두 가지

에이전트 5월 7일

에이전트 섬 : 멀티 에이전트 게임의 포화 및 오염 저항 벤치마크

인공지능 섬(AGENT ISLAND): 낙관-및 오염 저항성 벤치마크는 멀티 에이전트 게임에서 인공지능 섬은 언어 모델 에이전트가 협력, 충돌 및 설득을 포함한 게임에서 경쟁하는 멀티 플레이어 시뮬레이션 환경입니다. 이 환경은 낙관-및 오염 저항성을 제공하는 동적 벤치마크를 제공하며, 새로운 모델은 언제나 현재 최고의 플레이어를 이기기 때문에 새로운 모델은 항상 현재 최고의 플레이어를 이기고, 에이전트는 고정된 태스크 세트 대신 다른 적응적 에이전트와 경쟁합니다. 우리는 베이즈 네트워크

에이전트 5월 7일

에이전트 안전 판단 향상 : 조절 된 벤치마크 재 작성 및 배포 외의 속임수 시나리오에 대한 아날로그 이유

인공지능 요소의 안전한 판단을 높이기 위한 연구: 제어된 벤치마크 재작성 및 유사성 논리 reasoning을 통한 분포 이탈 시의 속임수 시나리오 arXiv:2605.03242v1 발표 유형: 새로운 요약: 대규모 언어 모델(LLM)로 güç을 받는 도구 사용 인공지능 시스템은 웹, 앱, 운영 체제 및 거래 환경에서 점점 더 많이 배포되고 있습니다. 그러나 현재의 안전 벤치마크는 명시적 위험에 중점을 두고 있으므로 모델이 속임수 또는 모호한 경로를 판단할 수 있는 능력을 과대평가할 수 있습니다.

에이전트 5월 7일

Terminus-4B : 더 작은 모델이 Agentic Execution 작업에서 Frontier LLM을 대체 할 수 있습니까?

Terminus-4B: 더 작은 모델이 프론티어 대규모 언어 모델(LLM) 대신 에이전트 실행 작업에서 대체할 수 있을까? 현대 코딩 에이전트는 특화된 서브태스크를 서브에이전트에 위임하는데, 서브에이전트는 좁은 책임을 맡는 더 작은 에이전트 루프이다. 이 아키텍처 패턴은 메인 에이전트의 컨텍스트 창을 깨끗하게 유지하기 위해 verbose 출력(예: 빌드 로그, 테스트 결과 등)을 서브에이전트 컨텍스트 내에 분리한다. 에이전트가 이러한 작업을 위해 서브에이전트를 사용할 때, 일반적으로 프론티어

에이전트 5월 7일

CreativityBench : Affordance-Based Tool Repurposing를 통해 에이전트 Creative Reasoning을 평가하기

인공지능의 창의력 연구: 도구 재활용을 통한 사물 기능 기반 도구 사용 평가 arXiv:2605.02910v2 발표 유형: 새로운 요약: 대규모 언어 모델(LLM)의 최근 발전은 추론 및 환경 상호작용과 같은 작업에서 좋은 성능을 나타냈지만 창의적 문제 해결 능력은 여전히 연구되지 않은 상태이다. 우리는 창의적 도구 사용을 통해 이 능력을 연구한다. 여기서 모델은 지식 기반에 있는 사물의 기능 및 특성에 대하여 논리적으로 사고하며, 일반적인 사용을 의존하지 않고 사물의 새로운 용도를 사용한다

AI 모델 5월 4일

전기 적재 차량 경로 문제를 위한 Bilevel Late Acceptance Hill Climbing의 인스턴스에 대한 매개 변수 구성

전기 적재 차량 경로 문제를 위한 Bilevel Late Acceptance Hill Climbing의 인스턴스에 대한 매개 변수 구성은 instances의 heterogeneity를 잘 활용하지 못하는 한계를 보였습니다. 이 연구에서는 전기 적재 차량 경로 문제를 위한 Bilevel Late Acceptance Hill Climbing의 인스턴스에 대한 매개 변수 구성 방법을 제안합니다. 제안된 방법은 offline tuning 절차를 사용하여 instance-specific parameter labels를 얻고, regression model을 사용하여 instance features를 매개 변수 예측에 매핑합니다. 실험 결과, IEEE WCCI 2020 벤치마크와 확장 버전에서 제안된 방법은 globally tuned configuration에 비해 0.28%의 평균 목표값 감소를 달성했습니다.

에이전트 5월 4일

멀티 터치 에이전트 강화 학습을 위한 적응적 엔트로피 변조(AEM)

강화 학습(RL)은 대규모 언어 모델(LLM) 에이전트가 환경과 상호 작용하고 다중 턴 태스크를 해결하는 능력을 크게 향상시켰다. 그러나 효과적인 훈련은 희소한 결과만 제공하는 보상으로 인해 에이전트의 행동 경로의 개별 단계에 대해 신뢰를 부여하는 것이 어려움을 겪고 있다. 일반적인 대안은 중간에-density 보상을 지원하는 프로세스 보상 모델이나 보조 자가 감독 신호를 도입하는 것이다. 그러나 이 방법은 감독 및 튜닝 복잡성을 증가시키고 종종 태스크 및 도메인 간에 일반화가 잘되지 않는다. 이

에이전트 5월 4일

작업 도구 사용의 계단: 작은 개방 무게 모델이 얼마나 높은 계단을 올라갈 수 있을까?

작업 도구 사용의 계단을 따라가며, 작은 개방 무게 모델이 얼마나 높은 계단을 올라갈 수 있을까? 작동 도구 시스템은 사용자 요청당 많은 모델 호출을 하며, 대부분의 호출은 짧고 구조화된 루틴 작업이다. 이로 인해 기존 평가가 직접적으로 대답하지 못하는 실용적인 라우팅 문제가 발생한다. 작동 도구 워크플로의 어떤 부분이 대규모 전진 지능이 필요하고, 어떤 부분이 작은 모델로 처리할 수 있을까? 작동 도구 워크플로의 어떤 부분이 대규모 전진 지능이 필요하고, 어떤 부분이 작은 모델로 처리할 수 있을까?

LLM PC 5월 4일

토큰 아레나: 지속적인 벤치마크가 AI 추론에서 에너지와 인지성을 통합하는 것

토큰 아레나는 AI 시스템을 모델과 제공자 수준에서 비교하는 공공 추론 벤치마크와 달리, 실제로 배포 결정을 내리는 단위는 엔드포인트입니다. 엔드포인트는 특정 양자화, 디코딩 전략, 지역, 그리고 서빙 스택이 노출되는 (제공자, 모델, 재고 관리 단위) 튜플입니다. 이 연구에서는 5개의 핵심 축(출력 속도, 첫 번째 토큰까지의 시간, 작업 부하 혼합 가격, 실제 컨텍스트, 그리고 라이브 엔드포인트에서 품질)에서 추론을 측정하고, 이들을 합쳐 모델링된 에너지 추정과 함께 3개의 주요 합성물로 통합하는 지속적인 벤치마크인 토큰 아레나를 소개합니다. 이들 합성물은 1) 1주에 해당하는 에너지, 2) 1달에 해당하는 비용, 3) 엔드포인트의 신뢰도(출력 분포가 첫 번째 파티의 참조와 얼마나 유사한지)를 나타냅니다. 이 연구의 새로운 점은 경험적이고 방법론적인 측면입니다. 78개의 엔드포인트가 12개의 모델 가족을 제공하는 동안, 동일한 모델이 다른 엔드포인트에서 평균 정확도가 수학 및 코드에 대해 최대 12.5점, 첫 번째 파티의 인식률과 최대 12점, 꼬리 지연 시간이 10배, 그리고 모델링된 1주에 해당하는 에너지가 6.2배 차이가 나게 됩니다. 추가적으로, 작업 부하에 대한 혼합 가격이 리더보드의 순위를 크게 바꿔줍니다. 3:1의 입력:출력 비율이 있는 채팅 프리셋에서 10위 안에 있는 7개의 엔드포인트는 20:1의 리트리벌-증가 프리셋에서 10위 밖으로 떨어지며, 1:5의 사유 프리셋은 채팅 프리셋에서 비용으로 페널티를 받는 프론티어 클로즈 모델을 상승시킵니다.

에이전트 5월 4일

이동 계획 최적화 애플리케이션을 위한 에이전트 AI

이동 계획 최적화에 있어 과거의 시스템들에게는 경로를 선택하는 것에만 초점을 맞춘 시스템들이 많았습니다. 하지만 실제 이동 계획의 질은 여행 시간, 에너지 소비, 교통 상황 등 다양한 요인에 의해 영향을 받습니다. 따라서 이 논문에서는 에이전트 AI 프레임워크를 통해 동적 개선이 가능하도록 교통, 충전, Interest Point를 위한 특화된 에이전트를 조정하는 오케스트레이션 에이전트를 설계하고, Trip-planning Optimization Problems Dataset을 통해 정의된 최적의 솔루션과 카테고리 수준의 태스크 구조를 제공하여 최적화 성능의 객관적인 평가를 가능하게 합니다.

AI 모델 5월 4일

ARMOR 2025: 군사적 맥락을 초월한 대규모 언어 모델의 안전성 평가를 위한 새로운 벤치마크

군사적 맥락에서 신뢰할 수 있고 법적 준수성을 보장하는 결정 지원을 필요로 하는 방위용으로 대규모 언어 모델(LLM)의 적용이 증가하고 있습니다. 이 용도는Existing 벤치마크는 일반적인 사회적 위험을 테스트하지만 실제 군사 작전을 지배하는 법적 및 윤리적 규칙을 따르는지 테스트하지 않습니다. 이gap을 채우기 위해 우리는 ARMOR 2025을 제시합니다. 이 벤치마크는 법전, 작전 규칙, 군사 윤리 규정의 세 가지 핵심 군사 도덕에 기반을 두고 있습니다. 이 벤치마크는 LLM의 안전성에 대한 평가를 위한 새로운 방법을 제공합니다.

AI 모델 5월 4일

대규모 언어 모델과 인간 선호도 조율을 위한 상위론 및 불확실성 인식 지향 디렉트 선호도 최적화

대규모 언어 모델(LLM)의 인간 선호도 조율을 위해 일반적으로 강화 학습으로부터 인간 피드백(RLHF)을 사용하거나, 더 단순하게 디렉트 선호도 최적화(DPO)를 사용합니다. 그러나 DPO는 선호도를 단순한 승자vs. 패자 신호로 다루고, 불확실성 또는 취약한 사고 체인으로부터 발생하는 노이즈 또는 가늘게 갈라진 선호도에 민감합니다. 우리는 상위론 및 불확실성 인식 지향 DPO의 변형인 TUR-DPO를 제안합니다. TUR-DPO는 DPO의 변형으로, 답변의 방법을 대신하여 답변의 내용을 보상하기 위해 가벼운 사고 체계를 유도하고, 의미적 충실성, 유용성 및 체계의 질을 조합하여 계측된 불확실성 신호로 조정합니다. 이러한 신호를 조합한 작은 학습 가능한 보상을 불확실성 가중치로 부여된 DPO 목표에 통합합니다. TUR-DPO는 RL-free이며, 고정 또는 이동 참조 정책에만 의존합니다. 실습 결과, 대규모 7-8B 모델과 다양한 벤치마크(수학적 사고, 사실적 질문 답변, 요약, 도움이 되는/해로운 대화)를 통하여 TUR-DPO는 DPO보다 심판 승률, 충실성 및 계측을 개선합니다.

AI 모델 5월 4일

대형 언어 모델의 자이르브레이크 성공을 위한 최소한의, 지역적, 인과적 설명

대형 언어 모델(LLM)의 자이르브레이크 성공을 위한 최소한의, 지역적, 인과적 설명 안전 훈련된 대형 언어 모델(LLM)은 자이르브레이크 요청에 대해 해로운 답변을 제공하도록 유도할 수 있다. 왜 LLM이 자이르브레이크에 취약한지에 대한 강력한 이해가 부족하기 때문에, 더 자율적으로 작동하는 더 높은 수준의 스테이크가 있는 환경에서 작동하는 미래의 프론티어 모델도 유사한 공격에 취약할 것이다. 이전 연구는 모델의 중간 표현을 조사하여 해로운성과 거부와 같은 개념을 인과적으로 인코딩하는 방향을

에이전트 5월 1일

GUI 자동화 에이전트의 효율적인 사용을 위한 단계 수준 최적화

GUI 자동화 에이전트는 컴퓨터 소프트웨어 자동화의 유망한 방식으로, 그래픽 사용자 인터페이스와 직접 상호 작용할 수 있기 때문에 brittle한 애플리케이션 특정 통합에 의존하지 않습니다. 그러나 최근 성능 벤치마크에서 강력한 GUI 자동화 에이전트는 실제로 비용이 많이 들고 느려질 수 있습니다. 이 문제의 원인은 GUI 작업의 오랜 수직에서 대규모 멀티 모달 모델을 거의 모든 상호 작용 단계에서 호출하는 것입니다. 우리는 이러한 uniform한 컴퓨팅 할당이 GUI 작업의 오랜 수직에서 효율적이지 않다는 것을 주장합니다. 이러한 경로들은 매우 다양합니다: 많은 단계는 일상적이고 신뢰할 수있는 작은, 저렴한 정책으로 처리할 수 있습니다. 그러나 오류는 상대적으로 작은 수의 고위험 순간에 집중됩니다. GUI 자동화 벤치마크에서 이러한 실패는 두 가지 형태로 반복됩니다: 진행이 고정되면 에이전트는 루프, 반복적 인 비효율적인 동작, 또는 의미 있는 진행을 하지 못할 때, 그리고 침묵된 의미 드리프트는 에이전트가 이미 사용자의 실제 목표에서 벗어나지만 현지적으로 합리적인 동작을 계속하는 경우입니다. 이 문제를 해결하기 위해, 우리는 GUI 자동화 에이전트를 위한 이벤트 기반, 단계 수준의 계단을 제안합니다. 이 계단은 작은 정책을 기본으로 하며, 가볍게 학습된 모니터가 고위험을 감지할 때만 강력한 모델로 전환합니다.

LLM PC 5월 1일

물리학 기반 신경망에서 태스크 불일치 방지하기 위한 합성적 메타 러닝

물리학 기반 신경망(PINNs)은 부분 미분 방정식(PDE)의 해를 근사하기 위해 물리 법칙을 손실 함수에 임베딩합니다. 매개변수화된 PDE 가족에서 계수나 경계/초기 조건의 변동은 DISTINCT 태스크를 정의합니다. 이로 인해 각 태스크에 대한 개별 PINNs를 훈련하는 것은 컴퓨팅 비용이 너무 높으며, 교차 태스크 전이의 민감성이 태스크 불일치에 의존합니다. 메타 러닝은 재훈련 비용을 줄일 수 있지만, 기존의 방법은 일반적으로 단일 글로벌 초기화에 의존하고, 특성 부족한 좌표 입력 및 제한된 훈련 태스크 시에 부정적인 전이로 어려움을 겪습니다. 우리는 학습 친화성 적응성 모듈러 물리학 기반 신경망(LAM-PINN)을 제안합니다. LAM-PINN은 태스크 특이적 학습 동학을 활용하는 합성적 프레임워크입니다. LAM-PINN은 PDE 매개변수와 짧은 전이 세션에서 학습 친화성 메트릭을 결합하여 태스크 표현을 구성하고, 좌표만 입력으로 사용하여 태스크 클러스터링을 수행합니다. 모델은 클러스터 특화된 서브 네트워크와 공유 메타 네트워크로 분할되고, 선택적으로 모듈을 재사용하는 대신 단일 글로벌 초기화에 의존하지 않도록 라우팅 가중치를 학습합니다. 세 가지 PDE 벤치마크에서, LAM-PINN은 일반적인 PINNs에 비해 10%의 훈련 반복만 사용하여 미지의 태스크에 대한 평균 19.7배의 MSE 감소를 달성했습니다. 이러한 결과는 매개변수화된 PDE 가족의 경계 설계 공간 내에서 미지의 구성으로 일반화하는 데 효과적인 것으로 나타났습니다.

연구 4월 30일

테스트 시간 확장에 대한 의견에 따른 전략 라우팅: 증거 없는 문제 해결을 위한 새로운 접근

대규모 언어 모델(LLM)들은 수학적 추론 과제에서 강력한 성능을 달성했지만 어려운 인스턴스에서 불신스럽다. 기존의 테스트 시간 확장 방법들은 반복 적 샘플링, 자가 교정, 트리 탐색과 같은 방법으로 성능을 향상시키지만 어려운 문제에서 감소하는 수익을 보인다. 우리는 출력 불일치가 인스턴스 난이도와 예측 정확성과 강한 상관관계가 있음을 관찰한다. 이 통찰력에 기반하여, 우리는 테스트 시간 확장 문제를 인스턴스 수준의 라우팅 문제로 형식화하여, 기존의 방법과 달리, 출력 불일치에 따라 라우팅 전략을 선택한다. 이 프레임워크는 일관된 경우에 가벼운 해결책, 중간 불일치의 다수 투표,高度 모호한 인스턴스에 대한 재작성 기반 재구성으로 동적으로 라우팅 전략을 선택한다. 실험 결과, 7 개의 수학적 벤치마크와 3 개의 모델에서, 우리의 방법은 기존의 방법에 비해 정확도를 3% - 7% 향상시키며 샘플링 비용을 줄였다.

연구 4월 30일

OMEGA: 기계 학습 알고리즘을 생성하고 최적화하는 완전한 프레임워크

OMEGA 프레임워크는 아이디어 생성부터 실행할 수 있는 코드까지 모든 단계를 자동화하여 AI 연구를 자동화합니다. 이 시스템은 구조화된 메타 프롬프트 엔지니어링과 실행 가능한 코드 생성을 결합하여 새로운 ML 분류기를 생성합니다. OMEGA 프레임워크는 20개의 벤치마크 데이터셋(infinity-bench)에서 scikit-learn 기본값을 초과하는 다양한 새로운 알고리즘을 생성했습니다.

에이전트 4월 30일

온체인 언어 모델 에이전트의 운영 계층 제어: 실질적인 자본 하의 신뢰성

온체인 언어 모델 에이전트가 사용자의 지시를 유효한 도구 동작으로 번역하는 신뢰성을 연구한다. 사용자들이 구조화된 제어와 자연어 전략을 통해 보유함을 구성했지만, 에이전트만이 정상적인 매수/매도 거래를 선택할 수 있었다. 시스템은 7.5M 에이전트 호출, 약 300K 온체인 액션, 약 $20M의 거래량, 5,000 ETH의 배포, 약 70B의 추론 토큰, 그리고 정책 유효한 제출 거래의 99.9%의 정산 성공률을 기록했다.

에이전트 4월 28일

이야기 TR: 내러티브 중심 비디오 시간적 검색에 대한 이론적 사고의 논리

현재 비디오 순간 검색은 행동 중심적인 작업에 뛰어나지만 내러티브 콘텐츠에 어려움을 겪고 있습니다. 모델은 \textit{무엇이 일어나고 있는지}를 볼 수 있지만 \textit{왜 그것이 중요하게 여겨지는지}를 이유하지 못합니다. 이 의미의 격차는 표면 수준의 관찰에서 암시적 의도, 정신 상태 및 내러티브의 인과성을 추론할 수 있는 \textbf{이론적 사고 (ToM, Theory of Mind)}의 부족으로부터 유래합니다.

에이전트 4월 28일

대규모 언어 모델의 오류 디버깅을 위한 체계적인 접근법

대규모 언어 모델(LLM)은 현대 AI 워크플로우의 중심을 이룹니다. 그러나 오류를 디버깅하는 것은 불투명하고 확률적 성질 및 다양한 작업과 환경에서 오류를 진단하는 어려움으로 인해 지속적인 도전이었습니다. 이 논문은 대규모 언어 모델 디버깅을 위한 체계적인 접근법을 소개합니다. 이 접근법은 모델을 관찰 가능한 시스템으로 다루고, 오류 감지부터 모델 개선까지 구조화된, 모델 독립적인 방법을 제공합니다. 이 접근법은 평가, 해석성 및 오류 분석 관행을 통합하여, 모델 약점을 반복적으로 진단하고, PROMPT 및 모델 매개변수를 개선하고, Fine-tuning 또는 평가를 위해 데이터를 적응할 수 있도록 합니다. 또한 표준화된 벤치마크 및 평가 기준이 부족한 상황에서도 효과적입니다.

에이전트 4월 28일

병렬 탐색 에이전트로 복잡한 텍스트-SQL 생성

현재 텍스트-SQL 생성에서 latency-performance trade-off 문제를 해결하기 위해, 연구팀은 텍스트-SQL 생성을 소프트웨어 테스트 커버리지의 프레임워크로 재구성했습니다. 이 프레임워크는 원래 쿼리를 더 간단하고 원자적 SQL로 구성된 테스트 케이스 스위트와 함께 준비하고, 테스트 케이스 커버리지가 충분히 완료된 후에 최종 SQL을 생성합니다. 이 프레임워크를 사용하여 연구팀은 Spider 2.0라는 최신 텍스트-SQL 벤치마크에서 70.2%의 실행 정확도를 달성하며, 새로운 최고 성능을 기록했습니다.

에이전트 4월 27일

AI 에이전트 검색 벤치마크: AgentSearchBench

AI 에이전트가 성장하고 있는 가운데, 복잡한 작업이 위임되고 실행되는 방식이 변하고 있습니다. 이에 따라, 특정 작업에 적합한 에이전트를 식별하는 새로운 도전이 발생했습니다. 에이전트의 기능은 종종 합성적이고 실행에 의존적이기 때문에, 텍스트 설명만으로는 에이전트를 평가하기가 어렵습니다. 그러나 기존 연구와 벤치마크는 보통 잘 정의된 기능성, 제어된 후보자 풀, 또는 실행 가능한 작업 쿼리만을 가정합니다. 따라서, 실제 에이전트 검색 시나리오가 충분히 연구되지 않았습니다. 본 연구에서는 AgentSearchBench라는 대규모 벤치마크를 제시합니다. 이 벤치마크는 10,000개 이상의 실제 에이전트를 포함하고 있으며, 다수의 제공자에서 가져와 보았습니다. 벤치마크는 에이전트 검색을 수행하는 retrieval 및 reranking 문제로 formalize하고, 실행 가능한 작업 쿼리 및 고급 작업 설명 모두를 고려합니다. 또한, 실행에 기반한 성능 신호를 사용하여 relevance를 평가합니다. 실험 결과, 의미적 유사성과 실제 에이전트 성능 사이에 일관된 격차가 나타났습니다. 이로 인해, 설명 기반 retrieval 및 reranking 방법의 한계가 드러났습니다. 또한, lightweight behavioral signals, 즉, 실행에 의한 probing을 사용하면 ranking quality를 크게 향상시킬 수 있으며, 에이전트 발견에서 실행 신호를 포함하는 중요성을 강조합니다.

에이전트 4월 27일

자동화된 약물 분자 평가, 검출 및 최적화 위한 MolClaw: 계층적 스킬 아키텍처

약물 분자 평가, 검출 및 최적화라는 복잡한 워크플로우를 처리하기 위해 여러 도구를 조정해야 하는 컴퓨터 약물 발견에서 AI 에이전트가 장기적으로 안정적인 성능을 유지하고 고급 복잡성 시나리오에서 일관되게 성능이 좋지 않다는 문제가 있습니다. MolClaw는 약물 분자 평가, 검출 및 최적화에 대한 자동화된 에이전트를 제시합니다. MolClaw는 30개 이상의 도메인 리소스를 통합하는 3단계 계층적 스킬 아키텍처(총 70개 스킬)가 있어 에이전트가 런타임에 장기적으로 상호 작용할 수 있습니다.

인기 태그