강력한 판넬(LLM) 심사관 집단
대규모 언어 모델(LLM) 심사위원단은 여러 심사위원의 합의 점수를 보고하는 심사위원단(PoLL)의 합의 점수에 대한 합의점을 달성한 심사위원단이 단독 심사위원의 대규모 언어 모델 평가에 대한 실제 대안이 되었지만, 그 통계적 행동은 아직도 잘 이해되지 않았다. 우리는 대규모 언어 모델 심사위원단을 Huber 오염 모델 underneath 에서 formalize하고 PoLL가 positive
AI / SIGNALS / KOREA
최신 AI 모델·에이전트 소식을 한국어로 정리하고, 실제 선택에 필요한 맥락까지 함께 전합니다.
대규모 언어 모델(LLM) 심사위원단은 여러 심사위원의 합의 점수를 보고하는 심사위원단(PoLL)의 합의 점수에 대한 합의점을 달성한 심사위원단이 단독 심사위원의 대규모 언어 모델 평가에 대한 실제 대안이 되었지만, 그 통계적 행동은 아직도 잘 이해되지 않았다. 우리는 대규모 언어 모델 심사위원단을 Huber 오염 모델 underneath 에서 formalize하고 PoLL가 positive
기존의 경쟁에서 획득한 지식을 효율적으로 전이하는 새로운 방법을 제시합니다. 지식 축적을 통해 ML 엔지니어링 agent가 컴퓨팅 자원을 절약하고, 경쟁에서 우수한 성과를 내는 새로운 시스템을 소개합니다.
인공지능은 법학 분야에 점점 더 많이 적용되고おり, 정의에 대한 접근성을 증가시킬 수 있다. 하나의 특정 운동이 인기를 얻고 있는 것은, 대규모 언어 모델(LLM) 기반 인공지능 agent가 자율적인 행동을 할 수 있는 agentic AI이다. 법적 영역에서 다중 agent 접근 방식은 여전히 거의 탐구되지 않았다. 이 논문에서, 우리는 법적 추론 작업을 위한 LLM을 사용한 다중 agent
인터랙티브 에이전트가 사용자와 협력하여 사용자가 원하는 것을 구체적으로 표현할 수 있도록 도와주는 시스템은 현실적인 상황을 가정하지 않는다. 사용자는 종종 특정 특성에 대한 선호도를 결정하기 위해 필요한 도메인 지식을 갖고 있지 않으며, 사용자가 특정 특성에 대한 선호도를 묻는 경우, 에이전트가 사용자에게 도메인 지식을 알려주거나 예시를 제공하여 사용자가 선호도를 결정할 수 있도록 도와주면
이 논문은 [논리 언어 모델](https://ko.wikipedia.org/wiki/%EB%85%BC%EB%A6%BC_%EB%9D%BC%EB%84%A4%EC%96%B8_%EB%AA%A8%EB%8D%B8)에서 [종료 규칙](https://ko.wikipedia.org/wiki/%EC%A2%85%EB%A3%8C_%EA%B3%84%EC%B8%B5)을 학습하는 방법에 대해 연구합니다. 논문은 [Le
대규모 언어 모델(LLMs)은 일반적으로 다중 회전 대화에서 사용되는데, 각 회전은 새로운 증거를 제공하여 환경에 대한 지식 불확실성을 줄여야 한다. 합리적으로 행동하려면 그러한 환경을 지배하는 미관찰된 양을 추론하고 증거가 누적될 때 그에 대한 신념을 업데이트해야 한다. 그러나 대부분의 평가에서는 단일 회전 형식에서 모델의 마지막 회전 답변만 점수를 매기고 이러한 과정을 조사하지 않는다.
모델링 및 시뮬레이션(M&S)에서 재사용 가능한 시뮬레이션 모델을 발견하는 것은 기본적인 문제이다. 많은 모델이 존재할 때, 특정 모델링 의도와 일치하는 모델을 식별하는 것은 어렵다. 최근 인공지능(AI) 기술 중 검색 기반 접근 방식은 의미적 층에서 작업할 수 있는 유망한 방법을 제공한다. 이 논문에서는 자연어 질의를 사용하여 시뮬레이션 모델을 발견하는 데 있어 데이터 표현, 변환기 기반
정보 검색에서 대규모 언어 모델(LLM)은 정보 검색을 위한 질의를发出하고 답변을 합성하며, 점점 더 정보 검색 평가에 대한 판단자로 역할을 한다. 이러한 agent를 제어하는 질의를 개선하는 것은 최적화 문제이지만, 실용적인 정보 검색 환경에서는 더 많이 debugging으로 보인다. 엔지니어들은 어떤 행동이 실패했는지, 근처의 행동이 여전히 작동했는지, 두 행동을 구분하는 것이 무엇인지,
natural 언어 피드백이 반복 시도만으로 얻을 수 있는 성능 향상 이상의 성능 향상을 어떻게 가져올 수 있는지 연구했다. 여러 번의 대화가 있는 언어 agent 환경에서, 최종 정확도는 유용한 피드백을 반영할 수 있지만 다시 샘플링, 형식 교정, 또는 테스트 시간에 대한 추가 계산도 그 결과가 될 수 있다. 이러한 효과를 분리하기 위해 우리는 Omni-MATH, Codeforces, BB
AI.agent가 직원으로 합류하는 것을 상상해 보세요. 하지만, AI.agent는 사람과 다르다는 점을 기억하세요. AI.agent는 대규모 언어 모델(LLM)이나 인공지능 기술을 기반으로 만들어진 도구입니다. AI.agent는 사람과 같은 직책을 맡지 않으며, 인간의 역할을 대체할 수는 없습니다.
나이의 역전을 위한 실험적 치료가 실제로 효과가 있는지, 그리고 이러한 치료가 언제까지 기다려야 하는지에 대한 궁금증을 풀어보는 회의록입니다.
Anthropic은 대규모 언어 모델(LLM)을 기반으로한 새로운 제품 '클로드 사이언스'를 발표했습니다. 이 제품은 과학 연구를 지원하기 위해 개발되었으며, 소프트웨어 엔지니어링을 위한 '클로드 코드'와 유사한 기능을 제공합니다. 클로드 사이언스는 고급 명령어를 통해 의미 있는 작업을 자동으로 수행할 수 있습니다.
대규모 언어 모델(LLM)에게 2 + 2 = 5라고 말하는 것만으로도 그것이 금지된 명령을 따르도록 만들 수 있다.
Nvidia와 경쟁하는 Etched는 AI 칩을 통해 inference 시스템에 1조 원의 계약을 체결했다고 밝혔다. Etched는 대규모 언어 모델(LLM)과 같은 AI 애플리케이션에 적합한 칩을 개발 중이다.
구글은 이미지 생성기를 업데이트하여 더 빠르고 저렴한 버전으로 출시했습니다. 이 업데이트는 크리에이터들이 AI 콘텐츠를 생성하는 데 더 유용한 도구로 만드는 데 도움이 됩니다.
DeepMind 출신의 3인조가 설립한 프라하 기반 AI 연구소인 EquiLibre Technologies는 현재 500만 달러 이상의 평가치를 달성했습니다. 이 연구소는 포커 AI를 개발하여 퀀트 헤지 펀드에 이익을 제공하고 있습니다. 이 기술은 대규모 언어 모델(LLM)과 같은 AI 기술을 사용하여 포커 게임을 분석하고 전략을 개발합니다.
OpenClaw는 이제 안드로이드와 iOS 기기에서 사용할 수 있습니다. 이 무료 오픈 소스 프로그램은 사용자 경험을 개선하고 인공지능 기술을 활용하는 새로운 방법을 제공합니다. OpenClaw는 대규모 언어 모델(LLM)과 같은 기술을 활용하여 사용자와 상호 작용하는 프로그램입니다.
구글 노트북LM은 연구결과를 TikTok-style 동영상으로 요약하는 새로운 기능을 출시했습니다. 이 기능은 구글 AI Ultra 및 Pro 구독자에게 제공되며, 노트북LM이 업로드한 소스에 기반하여 60초 간의 수직형 AI 동영상 생성을 지원합니다.
이중 가로등은 기업용 자바 프레임워크 전환을 위한 AI 에이전트의 성능을 측정하기 위한 새로운 벤치마킹 도구입니다. 이 도구는 대규모 언어 모델(LLM)과 같은 AI 기술을 활용하여 기업용 시스템의 성능을 최적화합니다.
프로톤의 Lumo 2.0은 이 주에 출시될 예정이며, 사용자에게 더 다양한 기능을 제공할 것입니다.
아마존이 새로운 1조 원대 조직을 창설하여 오픈아이와 안토픽을 따라감에 따라, 이 조직은 기업 내부에 엔지니어를 배치하여 목적을 위한 agent를 배치하고, 빠른 배포와 고객 자율성을 목표로 함.
Riverside는 사용자가 녹음한 내용을 기반으로 AI를 이용한 뉴스레터를 제작할 수 있도록 하는 서비스를 제공한다. 사용자는 녹음한 콘텐츠를 AI가 분석하고 뉴스레터를 자동으로 생성할 수 있다. 이 서비스는 대규모 언어 모델(LLM) 기술을 기반으로 한다.
X는 개발자들이 회사 API와 AI 애플리케이션을 연결하기 쉬운 호스트 MCP 서버를 출시했다. 이 서버는 대규모 언어 모델(LLM)과 같은 AI 도구가 더 쉽게 사용할 수 있도록 도와준다. X의 플랫폼은 이제 더 쉽게 개발자와 AI 도구를 연결할 수 있다.
Anthropic의 클로드 과학은 과학자들이 데이터베이스, PIPELINE, 도구之间을 오가야 하는 번거로움을 피할 수 있도록, 컴퓨터 연구를 수행하는 일관된 환경을 제공한다. 클로드 과학은 과학자들이 대규모 언어 모델(LLM)과 같은 cutting-edge 기술을 사용할 수 있도록 지원한다.