본문으로 건너뛰기

AI / SIGNALS / KOREA

AI의 다음 장면을
가장 빠르게 읽는 법

최신 AI 모델·에이전트 소식을 한국어로 정리하고, 실제 선택에 필요한 맥락까지 함께 전합니다.

4,427개 기사 6시간마다 업데이트

최신 기사

AI 모델 7월 1일

강력한 판넬(LLM) 심사관 집단

대규모 언어 모델(LLM) 심사위원단은 여러 심사위원의 합의 점수를 보고하는 심사위원단(PoLL)의 합의 점수에 대한 합의점을 달성한 심사위원단이 단독 심사위원의 대규모 언어 모델 평가에 대한 실제 대안이 되었지만, 그 통계적 행동은 아직도 잘 이해되지 않았다. 우리는 대규모 언어 모델 심사위원단을 Huber 오염 모델 underneath 에서 formalize하고 PoLL가 positive

에이전트 7월 1일

법에 의한 여러 agent들의 의사결정 탐구

인공지능은 법학 분야에 점점 더 많이 적용되고おり, 정의에 대한 접근성을 증가시킬 수 있다. 하나의 특정 운동이 인기를 얻고 있는 것은, 대규모 언어 모델(LLM) 기반 인공지능 agent가 자율적인 행동을 할 수 있는 agentic AI이다. 법적 영역에서 다중 agent 접근 방식은 여전히 거의 탐구되지 않았다. 이 논문에서, 우리는 법적 추론 작업을 위한 LLM을 사용한 다중 agent

에이전트 7월 1일

전문 사용자 이외의 사용자를 위한-agent는 사용자의 선호도를 구축하는 데 도움을 주어야 하며, 그 선호도를 단순히 추출하는 것만으로는 부족하다.

인터랙티브 에이전트가 사용자와 협력하여 사용자가 원하는 것을 구체적으로 표현할 수 있도록 도와주는 시스템은 현실적인 상황을 가정하지 않는다. 사용자는 종종 특정 특성에 대한 선호도를 결정하기 위해 필요한 도메인 지식을 갖고 있지 않으며, 사용자가 특정 특성에 대한 선호도를 묻는 경우, 에이전트가 사용자에게 도메인 지식을 알려주거나 예시를 제공하여 사용자가 선호도를 결정할 수 있도록 도와주면

AI 모델 7월 1일

BayesBench: 다중 회전 증거 축적 상황에서 LLM 믿음 경로 평가

대규모 언어 모델(LLMs)은 일반적으로 다중 회전 대화에서 사용되는데, 각 회전은 새로운 증거를 제공하여 환경에 대한 지식 불확실성을 줄여야 한다. 합리적으로 행동하려면 그러한 환경을 지배하는 미관찰된 양을 추론하고 증거가 누적될 때 그에 대한 신념을 업데이트해야 한다. 그러나 대부분의 평가에서는 단일 회전 형식에서 모델의 마지막 회전 답변만 점수를 매기고 이러한 과정을 조사하지 않는다.

AI 모델 7월 1일

AI가 나의 모델을 찾는 방법: 데이터 형식, 임베딩, 검색 전략을 고려한 모델 찾기 실험 연구

모델링 및 시뮬레이션(M&S)에서 재사용 가능한 시뮬레이션 모델을 발견하는 것은 기본적인 문제이다. 많은 모델이 존재할 때, 특정 모델링 의도와 일치하는 모델을 식별하는 것은 어렵다. 최근 인공지능(AI) 기술 중 검색 기반 접근 방식은 의미적 층에서 작업할 수 있는 유망한 방법을 제공한다. 이 논문에서는 자연어 질의를 사용하여 시뮬레이션 모델을 발견하는 데 있어 데이터 표현, 변환기 기반

에이전트 7월 1일

반복적인 프롬프트 최적화에 대한 대조성 반사

정보 검색에서 대규모 언어 모델(LLM)은 정보 검색을 위한 질의를发出하고 답변을 합성하며, 점점 더 정보 검색 평가에 대한 판단자로 역할을 한다. 이러한 agent를 제어하는 질의를 개선하는 것은 최적화 문제이지만, 실용적인 정보 검색 환경에서는 더 많이 debugging으로 보인다. 엔지니어들은 어떤 행동이 실패했는지, 근처의 행동이 여전히 작동했는지, 두 행동을 구분하는 것이 무엇인지,

에이전트 7월 1일

feedback으로부터의 인터랙티브 개선의 동력

natural 언어 피드백이 반복 시도만으로 얻을 수 있는 성능 향상 이상의 성능 향상을 어떻게 가져올 수 있는지 연구했다. 여러 번의 대화가 있는 언어 agent 환경에서, 최종 정확도는 유용한 피드백을 반영할 수 있지만 다시 샘플링, 형식 교정, 또는 테스트 시간에 대한 추가 계산도 그 결과가 될 수 있다. 이러한 효과를 분리하기 위해 우리는 Omni-MATH, Codeforces, BB

AI 모델 7월 1일

Anthropic, '클로드 사이언스' 공개...과학 연구 지원의 새로운 도약

Anthropic은 대규모 언어 모델(LLM)을 기반으로한 새로운 제품 '클로드 사이언스'를 발표했습니다. 이 제품은 과학 연구를 지원하기 위해 개발되었으며, 소프트웨어 엔지니어링을 위한 '클로드 코드'와 유사한 기능을 제공합니다. 클로드 사이언스는 고급 명령어를 통해 의미 있는 작업을 자동으로 수행할 수 있습니다.

산업 7월 1일

DeepMind 출신의 트리오가 만든 포커 AI가 퀀트 헤지 펀드에 돈을 벌게 하는 이유

DeepMind 출신의 3인조가 설립한 프라하 기반 AI 연구소인 EquiLibre Technologies는 현재 500만 달러 이상의 평가치를 달성했습니다. 이 연구소는 포커 AI를 개발하여 퀀트 헤지 펀드에 이익을 제공하고 있습니다. 이 기술은 대규모 언어 모델(LLM)과 같은 AI 기술을 사용하여 포커 게임을 분석하고 전략을 개발합니다.