본문으로 건너뛰기

#벤치마크

333개의 기사

AI 모델 2일 전

표면적인 디자인 너머: 사용자 시뮬레이터를 행동 일관성과 일치시키기

인터랙티브 인공지능(Interactive AI)을 대규모로 개발하고 평가하며 개선하는 데는 충실한 사용자 시뮬레이션(faithful user simulation)이 필수적입니다. 그러나 합리적인 개인적인 응답(plausible individual responses)이 실제 상호 작용에서 관찰되는 의도 진화(intent evolution)와 결과물(outcomes)을 재현하는 것은 보장하지 못

에이전트 2일 전

강화 학습 기반 역할 놀이 에이전트의 역할 학습을 위한 적대적 폐쇄 루프 교육과정

역할 연기하는 agent는 대규모 언어 모델을 기반으로 한 것들이 개인화된 지원 및 사회 시뮬레이션과 같은 분야에서 광범위하게 적용되어 왔다. 최근 RL 방법들은 학습이 시작되기 전에 미리 수집한 고정된 시나리오 풀에서 훈련을 받는다. 이로 인해 분포적 병목 현상이 발생한다: agent가 향상될수록 agent가 나쁜 성능을 보이는 시나리오도 변하고, 훈련 분포는 정적이다. 따라서, 우리는 역

AI 모델 2일 전

대화 기억의 Intervention 품질에 대한 제안된 Bench-mark인 TWIST: 인간이 검증한 Draft-Alignement

arXiv:2609.28575v1 발표 형식: 새로운 발표 요약: 장기 대화 메모리 벤치마크는 최근 사용자의 믿음과 메모리 상태의 진화에 대한 연구를 수행하는 동안 회상과 유도된 지식 업데이트와 관련된 회상 및 유도된 지식 업데이트 recall을 점점 더 테스트합니다. TWIST는 deployed 메모리 시스템의 intervention quality, 즉 belief change 지점에서 c

에이전트 2일 전

TW3Cast: 얼음처럼 고정된 라우터의 약간 조정된 기반 모델을 사용한 GIFT-Eval에 대한 시계열 예측을 위한 훈련 분할에 따라 전적으로 선택된 것

TW3Cast는 현재 2026년 9월 14일 기준 GIFT-Eval 벤치마크에서 평균 MASE rank 3위에 오른 시계열 예측 시스템입니다. TW3Cast는 agent나 대규모 언어 모델(LLM)을 사용하는 멀티 스텝 시스템이 포함된 리더보드 상위 두 개의 항목을 제외하고는 agent나 대규모 언어 모델(LLM)을 사용하지 않습니다. TW3Cast는 훈련 분할에서 한 번만 계산된 표를 사용

에이전트 3일 전

LLM agent가 방을 읽지 못할 때: 관계적 사회적 사고를 위한 ReAdapt

사회적 대상을 위한 기본적인 결정들(이 게시물을 반응해야 할까? 누구에게 연락해야 할까?)은純粹한 콘텐츠 문제가 아니다. 올바른 행동은 사람들 사이의 잠재적 관계에 따라 결정되는데, 그것은 연결의 강도, 상호 연결성, 상호 연결성에 의존한다. 대규모 언어 모델(LLM) agent 루프들은 표면적인 관계와 콘텐츠의 힌트가 다르면 새로운 관계적 증거가 agent의 현재 사회적 가설을 수정해야 하

에이전트 6일 전

계면 분자 최적화 방향으로 특이성 결합을 위한 접촉-차이 추론

약물의 부적절한 효과의 주요 원인은 작은 분자 약물의 타겟 단백질에 대한 부적절한 결합이다. 그러나 대부분의 구조 기반 분자 설계 방법은 기존의 잘 특성화된 약물의 선택성을 개선하는 대신 선택적인 화합물의 새로운 생성에 중점을 두고 있다. 우리는 기존 화합물의 구조적 정체성과 약물 성질을 보존하면서 타겟에 대한 결합 선호도를 개선하고 알려진 오프 타겟에 대한 선호도를 줄이는 구조적 수정을 위

에이전트 6일 전

agent가 더 높은 추상화 수준에서 칩을 더 잘 설계할 수 있을까?

대규모 언어 모델(LLM) agent는 반도체 설계에서 점점 더 많이 연구되고 있지만 대부분의 기존 방법은 직접 RTL에서 작동합니다. 우리는 agent가 상위 수준 추상화를 사용하여 더 좋은 반도체를 설계할 수 있는지 여부를 묻고 있습니다. 직접 RTL 설계, agent 기반 HLS 설계, 컴파일러 이후 HLS 정미, HLS 이후 RTL 정미를 비교하고, agent 기반 HLS 설계와 HL

에이전트 9월 15일

원인파악은 탐색 문제입니다: 장기적인 agent 실패의 계속적인 탐색

인공지능(AI) agent가 장기 목표를 달성하는 데 사용되는 기록의 양이 증가하고 있다. 이러한 기록 내에서 실패를 진단하는 것은 신뢰성에 필수적이기 때문에 결과 단계의 신호를 행동 가능한 조치를 변환시킨다. 이러한 데이터의 규모가 인간의 검토를 실용적으로 만들지 않기 때문에, 자동화된 원인 인식 Attribution (RCA)의 필요성이 생겼다. 그러나 대규모 언어 모델(LLM)을 사용한

AI 모델 9월 14일

사회 동력 예측을 위한 적대적 보상 추정 기반 생성 학습 (GLARE: Generative Learning via Adversarial Reward Estimation For Social Dynamics Forecasting)

회의 지속을 위해는 장기 다인 회의에서 agenda 추적, 발언자 역할, 참여자 의도 및 불일치 추적이 필요하다. 우리는 2,207 개의 실세계 회의와 24,794 개의 미래 지향적 쿼리에서 Meeting Dynamic Forecasting Benchmark(MDFB)를 소개한다. 회의 전면과 활성 질문이 주어졌을 때, 모델은 한 번의 호출로 가능성 있는 다중 회전 연속성을 생성한다. 우리는

에이전트 9월 12일

과목 없이 공부하는 것: 작업에 독립적인 환경 전처리

대규모 언어 모델(LLM) agent가 새로운 환경에서 작업을 수행하기 전에, 사용 가능한 자료집과 도구를 검사하고 재사용 가능한 리소스인 인덱스, 스크립트, 절차적 지침을 생성할 수 있다. 대부분의 자동 적응 방법은 however, however task 예시, 트래제키트, 또는 평가 feedback를 사용하여 어떤 것을 만들지 결정한다. 그러나 existing task-agnostic 방

AI 모델 9월 12일

임의성이 있는 의료 언어 모델에 대한 결정론적인 수학 풀이 도구 개발을 위한 방향

대규모 언어 모델은 산술 연산에서 불신할만큼 불신할 정도로 불안정하다. 이는 임상 계산기에서 단 하나의 숫자 오류가 권장 사항을 바꾸는 문제를 일으킨다. 표준적인 해결책은 각 계산기를 한 번씩 검증된 함수로 하드 코딩하는 것이다. 우리는 다른 대안을 시험해보았다. 모델은 산술 연산을 하지 않고, 대신에 사례별로 Python 코드를 작성하고, 제한된 지역 실행자로 실행되는 결정론적 해결책으로

AI 모델 9월 12일

IMO 금메달을 위한 열린 레시피: 올림피아드 수학을 위한 Nemotron 훈련

arXiv:2609.10712v1 발표 유형: 새로운 abstract: 우리는 hard olympiad 수학을 위한 자연어 증명 생성에 대한 모델 포스트-트레이닝 및 테스트-타임 추론 디자인의 영향을 연구합니다. Nemotron 3 Ultra에서부터, 우리는 지도 학습 및 강화 학습을 사용하여 두 가지 전문가 체크포인트를 훈련하고 체크포인트 선택, 검증 및 개선 평가를 수행합니다. 이러한 결

에이전트 9월 12일

자연어 설명으로부터 QUBO 형식 자동 생성: AI 기술의 새로운 획기적 발전

콤비네이터리 최적화 문제를 해결하기 위한 QUBO 형식 자동 생성이 가능해졌습니다. 이 기술은 자연어 설명을 분석하여 QUBO 형식을 자동 생성할 수 있는 멀티 에이전트 프레임워크를 개발하였습니다. 이 프레임워크는 68%의 정확도를 달성하였으며, 이전의 단일 호출 기반 baseline보다 22% 더 높은 정확도를 달성했습니다.

AI 모델 9월 11일

LLMs가 XAI 설명의 품질을 평가할 수 있나요?

인터프리블 AI(XAI) 방법의 설명 품질을 평가하는 것은 아직도 어려운 일이다. 현재 방법들은 주로 인간의 주관적인 판단에 의존하기 때문에 재현성, 확장성, 연구 간 비교가 제한된다. 우리는 대규모 언어 모델(LLM)을 이용하여 XAI 설명의 품질을 비교 평가하기 위한 재현성 있고 확장성이 높은 메커니즘으로 사용할 수 있는지 살펴보았다. 우리는 XAI-Arena이라는 LLM을 심판으로 사용

LLM PC 9월 11일

규모에 따른 중요한 물질 회수에 집중한 능동 학습

연구자들은 대규모 생산을 위해 회복 과정의 선택을 위해 실험실 결과와 제품 요구 사항, 공정 비용, 규모 효과를 연결하는 것이 필요하다. 우리는 퍼시픽 노스웨스트 국립 연구소의 컴퓨터 인텔리전스(CICERO) 워크플로우에서 자율적인 선택적 침전을 위한 기록을 분석했다. 활성 학습은 이전 결과를 사용하여 실험이 선택된다. 조건부 역사적 벤치마크에서 모델과 재활용된 네오디뮴-철-보르온(NdFeB

에이전트 9월 11일

AI 과학자 워크플로우 평가를 위한 프로세스 트레이스: OpenDiscoveryTrace

자율 AI 과학자들을 평가하는 현존하는 벤치마크들은 최종 출력물만 평가하고 그 출력물이 얻어진 추론 과정을 버린다. 이로 인해 과학적 방법론을 감사할 수 없으며, 실패 모드를 진단할 수 없으며, 체계적인 추론과 행운의 추측을 구별할 수 없다. 우리는 **OpenDiscoveryTrace**라는 공개 데이터셋을 제시하는데, 이 데이터셋은 558개의 완전한 AI 과학적 agent 경로를 캡처하여

AI 모델 9월 11일

OpenAI는 GPT-6 아스트라가 미스테리한 '외계 지능'으로, AGI와 같은 특성을 가지고 있다고 주장합니다. - 회사에서는 새로운 선구자로 등장한 새로운 국경의 정렬 도전을 경고합니다.

OpenAI는 새로운 GPT-6 Astra AI 모델을 내세우면서 많은 주장을 했지만, 그 모델은 분명히 능력 있는 모델입니다. 그러나 벤치마크 결과를 보면, 그 모델은 강점과 함께 일반적인 약점을 가지고 있는 것으로 나타났습니다. 가격과 접근성은 광범위한 사용을 위한 가장 큰 요인입니다.

AI 모델 9월 10일

LLM이 지원하는 체계적 문헌 고찰 시스템을 위한 BenchMark 및 설계 원칙

논문 제목: arXiv:2609.05505v1 발표 형식: 새로운 논문 요약: 시스템 검토는 수천 개의 기록에 대한 지속적인 인간 판단이 필요하지만, 기존의 대규모 언어 모델(LLM)의 평가에서는 검토 단계를 개별적으로 검토한다. 우리는 SciLitBench라는 제목과 초록 검토, 전체 텍스트 검토, 및 스키마에 따라 데이터 추출을 포함하는 다단계 벤치마크를 소개한다. 이 벤치마크는 42,9

인기 태그