BV-Blend: 불확실성 가중치 역사적 기준선으로 안정적인 비평자 없는 강화 학습
비평자 없는 강화 학습에서 BV-Blend을 사용하면 불확실성 가중치 역사적 기준선으로 안정적인 강화 학습을 구현할 수 있습니다. 이 방법은 대규모 언어 모델(LLM)과 같은 큰 언어 모델을 위한 강화 학습에서 중요합니다.
AI / SIGNALS / KOREA
최신 AI 모델·에이전트 소식을 한국어로 정리하고, 실제 선택에 필요한 맥락까지 함께 전합니다.
비평자 없는 강화 학습에서 BV-Blend을 사용하면 불확실성 가중치 역사적 기준선으로 안정적인 강화 학습을 구현할 수 있습니다. 이 방법은 대규모 언어 모델(LLM)과 같은 큰 언어 모델을 위한 강화 학습에서 중요합니다.
composition은 높은 수준의 시각적 의도입니다. 이 의도는 주체가 어디에 위치하고景면이 어떻게 조직되는지에 관해 규정합니다. 그러나 현재의 통합 멀티모달 모델은 세부적인 composition 인식에 대해 불신할 정도로 불안정하고 이러한 의도를 제어할 수 있는 생성을 힘들게합니다. 우리는 COMPASS를 제시합니다. COMPASS는 perception과 generation을 모두 포함하
치료를 위한 논리적 사유는 모든 치료 결정을 뒷받침하는 데 중요하며, 질병의 맥락, 동반 질병, 약물, 반대 여부, 그리고 발전하는 의학 지식과 적절한 치료를 선택하기 위해 통합된다. 이는 본질적으로 반복적인 과정을 의미하며, 후보 물건은 많은 제약을 고려하여 후보 물건을 개선하고 증거가 나오면 증거를 수집하고, 검증 가능한 원천에 근거하여 증거를 수집한다. 여기서 우리는 ATHENA-R1이
대규모 언어 모델(LLM)은 종종 여러 응답이 정당화될 수 있지만 다른 우선순위를 표현하는 다양한 우선순위를 갖는 эти학적 딜레마에 직면하게 된다. 예를 들어 공정성, 진실성, 용기, 또는 자제를 우선시할 수 있다. 우리는 VirtueMap이라는 프레임워크를 소개한다. VirtueMap은 아리스토텔레스의 도덕성 관점에서 이러한 패턴을 설명한다. 단일 정답만을 요구하는 대신, VirtueMa
현재 대규모 언어 모델(LLM)의 논리적 추론을 향상시키기 위한 접근 방식, 예를 들어 Chain-of-Thought와 "Wait" 지시어는 모델이 더 많이 생각하도록 유도하지만 종종 진실로 가도록 안내하지 못한다. Representation Editing(RepE)는 내재된 제어를 제공하지만 동적 추론 경로에 대한 응용은 아직 미흡하다. 이 연구에서는 추론 경로가 펼쳐질 때 진리의 기하학을
최근 대규모 언어 모델 및 시각-언어 모델의 발전으로 다중 모드 데이터에 대한 논리적 추론이 가능해졌고, 의료 적용 분야에서 의사결정 지원 및 전문의로의 분류와 같은 기회를 제공하고 있습니다. 그러나 현재 의료 AI 벤치마크는 분산되어 있습니다: 일부는 다중 턴 대화 지원을 제공하지만 이미지를 제공하지 못하고, 다른 벤치마크는 다중 모드 입력을 제공하지만 단일 턴 QA 작업에만 집중하고 있습
인공지능이 인간이나 다른 인공지능과 협력하여 작업을 수행하는 데 사용되는 다중 모드 모델의 사용이 점점 증가하고 있습니다. 현재 기준의 벤치마크는 이러한 모델이 여러 구성 요소의 능력을 갖추고 있음을 보여주지만 협력 시 발생하는 시간 압박, 정보 비대칭성 및 불완전한 통신과 같은 조건은 일반적으로 분리된 상태에서 연구됩니다. 우리는 협력하는 두 개의 agent가 반응 시간 내에 생성된 폭탄
대규모 언어 모델(LLM)의 전반적인 변수인 모델 능력은 직접 관찰되지 않습니다. 데이터는 미래에 모델 능력을 형성하며, 평가는 모델 능력을 후속적으로 노출합니다. 그러나 샘플, 프롬프트, 디코딩, 및 점수 규칙을 하나의 노이즈 점수로 압축합니다. 실제 최적화는 이 반대 방향으로 작동합니다. 엔지니어는 실패를 먼저 관찰하고, 데이터를 수정해야 합니다. 그러나 두 가지 측면은 상호 불일치하는 어휘를 사용합니다. 벤치마크 이름과 샘플당 정확도와 데이터 출처, 도메인, 및 품질 레이블을 사용합니다. 이 추론은 일반적으로 직관이 아닌 메소드입니다. 우리는 이 단절을 닫기 위해 <em>능력 슬라이스</em>를 사용합니다. 샘플이 공통된 배경 조건, 작업 유형, 해결 연산, 및 출력 제약 조건을 공유하는 평가 샘플의 집합입니다. 이 단일 약점을 지역화할 수 있을 정도로 정밀하지만, aggregation이 가능하며, 벤치마크 이름이 너무粗하고, 단일 샘플이 너무 노이즈가 많은 경우에도 안정적입니다. 이 단위로 구성된 평가 분류, 비-인스트럭션 데이터 분류, 및 매핑 규칙은 벤치마크 수준의 실패를 대상화 가능한, 테스트 가능한 데이터 조정을 위한 닫힌 루프를 형성합니다.
대규모 언어 모델(LLM) agent들은 무게 업데이트를 거치지 않고 자연어 아티팩트를 통해 개선되고 있다. 자연어 아티팩트는 반사, 워크플로우, 플레이북, 치트 시트, 또는 최적화된 프롬프트와 같은 것들이며, 동결된 정책을 조건화한다. 이러한 방법들은 일반적으로 단일 벤치마크에서만 도움이 된다는 점을 보고한다. 우리는 이러한 방법들을 하나하나 비교하고 더 명확한 그림을 드러내려고 한다. R
미국은 시그널과 위트썬을 해킹한 러시아 국영 그룹에 대한 정보를 제공하는 데 10만 달러의 보상을 제의했다. 이 러시아 국영 그룹은 적어도 3월부터 해킹 활동을 진행해왔다.
세계 두 번째-largest 메모리 칩 제조사들은 한국이 AI 기술 강국으로 자리매김하는 것을 본받아 더 많은 메모리 연구소 제조공장( fab)을 건설하기로 약속했다.
Anthropic은 캘리포니아 주와 더욱 가까운 관계를 맺고 있다. 이에 따라 연방 정부는 오픈에이아이의 경쟁자로 Anthropic을 적으로 선언했다.
구글(Google)은 미국의 자격이 있는 무료 사용자에게 개인화된 인공지능(AI) 이미지 생성기(Gemini)의 기능을 확장할 예정입니다. 이 기능을 통해 채팅봇이 사용자의 관심사와 연결된 구글(Google) 앱의 데이터를 바탕으로 이미지 생성이 가능해집니다.
오픈에이이는 7월 15일 Codex라는 AI가 구동하는 프로그래밍 도구와 관련된 장치를 출시할 예정입니다. 월요일에 X에 업로드된 비디오에서 오픈에이이는 여러 버튼이 있는 직사각형 모양의 장치를 보여주고, "당신이 좋아하는 Codex 단축키들은 업그레이드될 거야"라고 캡션을 달았습니다. 이건 오픈에이이가 개발 중인 [...]
티달은 15일부터 AI 음악에 대한 새로운 정책을 시행합니다. AI 음악은 100% AI가 생성한 음악을 의미하며, 티달은 이러한 음악을 labeling하여 사용자에게 표시할 예정입니다. 또한 AI 음악은 현재부터 monetization이 불가능합니다.
AI가 기계 번역을 대체할 수 있을까? 인공지능(AI)가 인간 번역가의 역할을 대체할 수 있을까? 기계 번역이 점점 더 발전하고 있지만, 여전히 인간 번역가가 필요하다는 결론을 내렸다. 미국 샌프란시스코에 있는 언어 기술 회사인 Systran은 2022년 6월에 1,000만 명 이상의 사용자가 사용하는 100개 언어를 지원하는 대규모 언어 모델(LLM)을 출시했다. Systran의 CEO 인
기술 세계의 오늘날 일상에서 일어나는 모든 일에 대한 일일 복약을 제공하는 우리의 주간 뉴스레터인 The Download의 오늘날 판입니다. 지표의 필연적인 약점 지표는 많은 유용한 정보를 제공할 수 있습니다. 그러나 오히려 지표는 더 많은 정보를 숨기거나 왜곡할 수 있습니다. 많은 사람들이...
2026년은 사업 목표와 AI 프로젝트를 조율하는 '인식 년'으로 불리며, 기업은 ROI를 증명하기 위해 에이전트 AI를 사용하여 가치 있는 금융 결과를 달성하려고 합니다. 에이전트 AI는 기술 리더와 최고경영자가 사업 목표를 달성하기 위해 찾고 있는 가치 있는 금융 결과를 달성하기 위한 새로운 기회입니다.
Omen AI는 31만 달러의 시리즈 A 펀딩을 통해 데이터 센터의 전자장치 수온을 모니터링하고, 그로 인한 세균 번식을 예방하는 데 도움을 주는 기술을 개발 중이다. 이 기술은 데이터 센터의 냉각 시스템을 개선하는 데 중요한 역할을 할 수 있다.
로봇 손 개발을 위한 새로운 접근법을採用하고 있는 스타트업, Proception은 어려운 로봇 문제 중 하나인 손의 개발을 위해 훈련 데이터를 수집하는 방법을 개선하고자 합니다. 테슬라와의 분쟁을 해결하고 1억1000만 달러를 모금하는 등 큰 성과를 거두고 있습니다.
티달(TIDAL)의 새로운 정책으로 인해 AI가 생성한 음악은 이 서비스에서 돈을 벌 수 없게 될 것입니다.
Cursor는 코딩 에이전트에 대한 원격 감시를 위한 새로운 모바일 앱을 출시했습니다.
아레나(Arena)는 무료 AI 랭킹리더보드를 운영하는 스타트업으로, 최근 9월에 상업 서비스를 시작했다. 아레나의 랭킹리더보드는 AI 개발자와 연구자들의 관심을 끌며, 대규모 언어 모델(LLM)과 같은 cutting-edge 기술을 지원한다. 아레나의 상업 서비스는 빠르게 성장하며, 1억 달러 기업으로 성장했다.
신종 제안이 나오고 있다. 이 제안은 미국인의 건강 정보와 위치 정보를 데이터 중개자에게 판매하는 것을 금지하도록 한다. 이 데이터 중개자에는 인공지능 챗봇과 같은 채팅봇인 ChatGPT나 Claude도 포함된다. 다음 몇 주 동안, 상원 의원 엘리자베스 워런(민주당, 매사추세츠 주)과 하원 의원 메리 게이 스캔론(민주당, 펜실베니아 주)은 건강 및 위치 정보 보호에 대한 새로운 법안을 발표