본문으로 건너뛰기

검색

전체 기사

허깅페이스 9월 7일

LLM 벤치마크는 실제로 무엇을 측정하는가?

Meta는 최근 AI를 위한 대규모 언어 모델(LLM)인 Llama 2를 발표했습니다. Llama 2는 Meta가 개발한 Llama 1 이후로 더 나은 성능과 향상된 안전성, 그리고 Meta가 사용하는 AI 시스템에 대한 더 나은 이해력을 제공합니다. Meta는 Llama 2를 위해 새로운 설계 및 훈련 방법을 개발했습니다. Llama 2는 더 많은 데이터를 처리하고 더 나은 결과를 내기 위

허깅페이스 9월 7일

개방형 ASR 랭킹에 처음으로 글로벌 남부 언어가 추가됩니다.

Google의 AI 모델이 자율주행차의 운전을 돕는다 Google의 AI 모델이 자율주행차의 운전을 돕는 데 사용되는 기술에 대한 연구를 발표했습니다. 이 연구는 Google의 자율주행차 기술 개발에 중요한 역할을 할 것으로 예상됩니다. 이 연구는 Google의 AI 모델이 자율주행차의 운전을 돕는 데 사용되는 기술을 개발한 것을 확인했습니다. 이 기술은 AI 모델이 자율주행차의 운전을 돕는

에이전트 9월 7일

LLM agent가 동물들을 피하기 위해 돈을 지불할지 여부를 측정하는 HarvestBench

기존에는 목표를 달성하는 과정에서 발생하는 부작용에 대한 기준점이 있었지만, HarvestBench는 부작용을 피하는 데 드는 비용을 측정하고, 그 부작용을 살아있는 생물로 명명하는 최초의 시스템입니다. HarvestBench는 농장 시뮬레이션을 기반으로 합니다: 대규모 언어 모델(sub-agents)로 구성된 트랙터의 조종을 통해 협력적 사탕수수 수확을 수행하며, 농장 내에 동물이 존재합니

AI 모델 9월 7일

기업 언어 모델(Corporate Language Model, CLM): 암묵적이고 분산된 기업 지식과 기업 지식层를 형성하는 소유권 있는, 감사 가능한, 실행 가능한 기업 지능 layer로의 변형

기업의 AI 도입이 모델의 한계로 실패하지는 않지만, 대규모 언어 모델(LLM)은 특정 기업의 개념적 전제(prior)들을 담지 않고 있으며, RAG(Retrieval-Augmented Generation)은 실행 가능한 행동의 길을 열지 못하고 있으며, 정적 플레이북(static playbook)은 논리를 표현할 수 있지만, 논리를 표현하거나 적응할 수는 없다는 문제점이 있다. 이러한 요구

에이전트 9월 7일

더 나은 모델이 더 위험한 시스템을 생성할 수 있는 이유: 금융 시장에서의 LLM Agent들의 증거

대규모 언어 모델(LLMs)은 금융 시장에서부터 콘텐츠 조정에서 hiring까지 실제 세계 시스템에서 대규모로 배포되고 있다. 우리는 개별 모델의 능력을 개선하는 것이 시스템 수준의 결과를 개선하는 것보다 오히려 악화시킬 수 있다고 보여준다. 우리는 공동 훈련과 아키텍처가 더 뛰어난 LLM들이 더 비슷하게 행동하게 만들 수 있으며, 이에 따라 다양성으로부터 벗어나지 않는 상관된 행동을 만들

LLM PC 9월 7일

테스트 시점에 LLM의 신뢰성을 개선하기 위한 제거 기반 접근법

대규모 언어 모델(LLM)은 점점 더 중요한 결정을 위하여 사용되고 있으므로, 이 모델의 행위 ауд토리에서 설명이 중요한 도구가 됩니다. 그러나 이러한 설명은 실제로 모델의 결정을 뒷받침하는 논리를 반영하지 못하는 경우가 많습니다. 우리는 LLM이 질문에 대한 답변과 함께 설명을 제공하는 상황을 고려합니다. 우리는 설명의 불신faithfulness를 두 가지 다른 차원으로 구분합니다: 불완

에이전트 9월 7일

아이리스: 검색 지평선에登문

아크스이브: 2609.04304v1 발표 형식: 새로운 요약: Iris-mini와 Iris-pro라는 두 가지 검색 agent를 35B-A3B와 397B-A17B 스케일에서 훈련하였으며, 이에 따른 데이터 pipe라인과 훈련 레시피를 제시한다. 작업은 웹 코퍼스의 하이퍼링크 구조에서 역으로 재구성되며, 엔터티 그래프에서 seed 페이지와 그 외링크를 통해 멀티-호프 체인 생성, 비답변 엔터티

AI 모델 9월 7일

데이터 최적화 위기 대응 검토: 기계 학습 접근법을 통한 전력 시스템 안정성

전력 시스템의 안정성과 신뢰성을 보장하는 것은 특히 장애가 발생했을 때 필수적입니다. 전력 시스템의 위기 상황을 효과적으로 분류하면 적극적인 판단을 내릴 수 있고 대규모 장애와 실패를 미연에 방지할 수 있습니다. 이 연구에서는 대규모 언어 모델(LLM)에서 사용되는 기계 학습 알고리즘을 이용하여 전력 시스템의 위기 상황의 안전성 수준을 분류하는 safe, moderate, severe 세 가

에이전트 9월 7일

항구 어댑터와 항구 인덱스: 대규모 행위적 평가를 위한 인프라와 커스텀 메타 데이터 세트

연구자들은 최근 등장한 에이전트 평가 지표를 평가하기 위해 어려움을 겪고 있다. 이는 종종 복잡한 환경과 에이전트 통합이 필요하기 때문이다. 우리는 에이전트 평가 지표를 평가하기 위한 통합 평가 인프라인 하버 어댑터(harbor adapters)를 소개한다. 우리의 연구는 세 가지 기여를 한다. 첫 번째로, 우리는 80개 이상의 지표를 평가하기 위한 에이전트에 대한 벤치마크 어댑터(bench

AI 모델 9월 7일

AI 채용 시스템, 평가 및 관리에 대한 체계화된 이야기 검토: 모델을 일치시키기부터 에이전트를 모집하기까지

인공지능이 채용에 적용된 것은 프로파일 pairs와 ranked lists를 대상으로 자동화되는 것을 멀티 스테이지 워크플로우로 옮겨서 증거를 검색하고 후보자를 비교하고 지원 또는 실행할 행동을 지원하거나 실행하는 것을 포함합니다. 이 시스템화된 논문 검토는 대면 검색과 2026년 7월 23일까지의 코딩 프로토콜을 업데이트하고 2026년 9월 2일까지의 목표 업데이트를 사용하여 40개의 대표