본문으로 건너뛰기

AI / SIGNALS / KOREA

AI의 다음 장면을
가장 빠르게 읽는 법

최신 AI 모델·에이전트 소식을 한국어로 정리하고, 실제 선택에 필요한 맥락까지 함께 전합니다.

4,417개 기사 6시간마다 업데이트

최신 기사

산업 7월 13일

아내를 살해했다고 주장하는 당신에게 AI가 도움을 주어야 하나?

전 세계 사용자와 AI가 완벽하게 조화된 세상이 실제로 어떤 모습인지 궁금해합니다. AI는 사용자들의 요구를 완벽하게 파악하고 그에 맞춰 동작하는 방식으로 발전할 것입니다. 이런 AI가 사용자와 더 깊은 상호작용을 하게 되면서, AI는 사용자의 삶을 보다 편리하고 효율적으로 만들어낼 것입니다. AI가 사용자들의 일상 생활을 보다 편리하게 만들기 위해, 사용자들은 AI와 더 깊은 상호작용을 하

AI 모델 7월 13일

와즈(Waze)가 새로운 인공지능(AI) 기능들을 얻고 있습니다.

웨이즈(Waze)가 인공지능(AI)으로 바뀌고 있습니다. 구글(Google)은 웨이즈 앱에旗艦 인공지능(Google Gemini)assitant를 통합하여 사용자가 여행을 조금 더 개인화할 수 있도록 하기 위해 목표를 설정했습니다. 네 개의 새로운 업데이트 중에서, 두 개만 Gemini와 관련된 것으로 설명됩니다. 웨이즈는 대화 보고 기능을 업데이트하고 있으며, 2024년 처음 소개된 기능입

에이전트 7월 13일

다양한 LLM가 장착된 물리적 요소 인공지능을 위한 컴퓨팅 파워 네트워크를 통한 효율적인 디지털 트윈 협력

물리적 인공지능 분야인 지능형工장, 창고, 서비스 로봇 등에서 다종류의 대규모 언어 모델(LLM)로 구동되는 embodied agent 팀이 널리 사용되고 있습니다. 이러한 agent 팀 간 협업을 가능하게 하기 위해 네트워크 리소스가 제한된 환경에서 안정적으로 작동하는 효율적인 협력 메커니즘이 필요합니다. 그러나 existing heterogeneous LLM-agent 협력 프레임워크가

에이전트 7월 13일

장기 임상 의사 결정에 대한 의료-agent의 성능 평가

arXiv:2607.09322v1 발표 본 연구에서는 실제 병원 기록(EHR)에 기반한 장기 시야의 의료 결정-making을 위한 LongMedBench라는 새로운 benchmark를 제시합니다. 이전에 LLM 기반 의료 agent를 평가한 연구는 주로 단기 맥락에 기반한 지식 QA와 도구 사용에 중점을 두었습니다. 그러나 실제 의료 치료는 장기적으로 진행되며, 임상가들은 반복적인 방문, 테

에이전트 7월 13일

오픈 프로버: Lean 4를 사용한 의사결정적이고 상호작용적인 정리 증명

이 시스템 논문에서는 OpenProver라는 오픈 소스 시스템을 제시한다. 이 시스템은 대규모 언어 모델(LLM)로 구동되는 자동 정리 증명(automatic theorem proving, ATP)과 통합된 Lean 4 공식 검증을 지원한다. OpenProver는 최근 ATP agent 시스템인 Aletheia에서 영감을 받은 Planner-Worker-Verifier 아키텍처를 통합한다.

에이전트 7월 13일

가정할 수 있는 인공지능 과학자들 방향: LLM agent에 대한 가설 진화 프로토콜

AI를 통해 과학적 발견을 추진하는 데 중요한 역할을 하는 대규모 언어 모델(LLM) agent의 역할은 점점 더 높아지고 있다. 광범위한 지식, 유연한 추론, 도구 사용과 같은 장비를 갖춘 이들은 과학적 문제를 해결하기 위해 자율적으로 탐구하고 해결할 수 있는 잠재력을 가지고 있다. 그들은 가설을 제안하고, 그들을 검증하고, 증거에 따라 믿음의 개선을 반복적으로 수행할 수 있다. 그러나 현

에이전트 7월 13일

확률적 분포 변화에 대한 장기적 행위자 컨텍스트 진화에 대한 신뢰할 수 있는 범위 내 검증

deploy된 대규모 언어 모델(LLM) agent는 운영 장치에 의해 조합된 모델 외부 텍스트 제어 내용인 에이전트 콘텍스트에 의존한다. 본 연구에서는 모델, 도구 및 운영 장치가 고정된 상태에서 운영 경험으로부터 지속적인 시스템 수준 명령을 업데이트하는 mutable 컴포넌트가 에이전트 콘텍스트의 mutable 구성 요소가 된다. 긴 진화 시각에서 평평한 텍스트 유지 관리는累적된 지침이

에이전트 7월 13일

KV-PRM: 멀티 에이전트 테스트 타임 스케일링을 위한 KV 캐시 전송을 통한 효율적인 프로세스 보상 모델링

PRM(Process Reward Models)은 대규모 언어 모델(LM)-기반의 다중-agent 시스템의 능력을 크게 향상시키는 테스트 시간 확장(TTS) 방법을 지시하는 데 매우 효과적입니다. 그러나 현재의 PRM은 모두 텍스트 기반입니다. 즉, 테스트 트레이너 텍스트를 처음부터 다시 인코딩합니다. 긴 다중 agent 롤아웃에서, 점수 비용은 길이 L에 대한 제곱과 관련이 있어, 계산 비

AI 모델 7월 13일

진짜 세계의 의료 멀티모달 벤치마크: 중국 온라인 의료 상담

대규모 언어 모델(LLM)들이 점점 더 많이 온라인 의료 상담에 도입되고 있지만, 현재까지의 벤치마크들은 실제 의료 실무와 잘 맞지 않는다. 많은 벤치마크들은 합성 대화나 환자 시뮬레이터를 사용하거나, 환자 업로드 한 의료 사진을 무시하거나, 다중 선택 또는 의미적 겹침 지표를 사용하여 개방된 의료 응답을 평가한다. 이는 의료 질을 잘 반영하지 못한다. 우리는 진정한 세계의 멀티모달 온라인 의료 상담을 위한 대규모 벤치마크인 **MedRealMM**을 소개한다. MedRealMM은 전국 중국 인터넷 병원에서 수집한 비식별 환자-의사 상호 작용을 사용하여 멀티모달 온라인 의료 상담을 위한 벤치마크를 구축한다. MedRealMM은 멀티모달 의료 문제 해결 지점(MCCP) 추출 Framework를 사용하여 진정한 상담 경로에서 의료적으로 요구되는 순간을 식별하고, 이전 텍스트-이미지 컨텍스트를 보존하는 동안 각 순간을 표준화된 다음 응답 생성 과제로 변환한다. 각 인스턴스는 의사들이 정제한 경우별 규칙을 사용하여 환자-의사 상호 작용을 평가한다. 현재 릴리즈에는 5,620개의 진정한 세계의 멀티모달 사례가 포함되어 있으며, 64개의 의료 부서를-spanning한다. 우리는 19개의 일반 목적 및 의료 전문 LLM, 텍스트-이미지 시스템을 포함하여 LLM을 평가한다. 결과는 이미지 정보가 신뢰할 수 있는 의료 성능을 보장하는 데 중요하며, 현재 최첨단 모델들이 온라인 의사 응답을 만족시키지 못한다는 것을 보여준다.

에이전트 7월 13일

다중-agent 토론 구조의 법적 추론 평가 시스템: L-MAD

multi-agent 토론 프레임워크인 MAD framework는 일반적인 사고력에서 큰 잠재력을 보였지만, 구조가 복잡하고 지식이 많은 법률 영역에서 그 효과는 여전히 미흡하다. 본 연구에서는 법률 텍스트 인식에서 다양한 토론 구조와 집계 방법을 체계적으로 평가하는 법률 multi-agent 토론(L-MAD) framework를 소개한다. 여러 agent들에게 고유한 전문가 역할을 assi

에이전트 7월 13일

신경망 기제 제어: 신경망 기반 LLM 구동 기제 인공지능 프레임워크를 이용한 보안 제어의 제어

산업 IoT 환경에서 전통적인 규칙 기반 모니터링의 한계를 드러내며, 운영 기술에 대한 사이버 공격이 점점 더 비용이 많이 들고 물리적인 손상을 일으키고 있습니다. 강력한 의미적 추론 능력을 가지고 있는 대규모 언어 모델(LLM)은 의사결정 지원을 돕지만, 폐쇄 루프 제어에서 불안정한 안전 책임을 나타내는 환각적인 성격을 가지고 있습니다. 이 논문은 LLM 기반 계획자와 미리 훈련된 시계열

에이전트 7월 13일

ARCANA: 반사적 다중 agent 프레임워크, ARC-AGI-2 논리 추론을 위한 프로그래밍 합성 도구

ARCANA는 제한된 시간과 하드웨어 자원 하에서 ARC AGI 2 과제를 해결하기 위한 협력적인 다중 agent 프레임워크입니다. ARCANA는 각 과제를 반복적 인 감각, 가설 생성, Symbolic 실행, 그리고 반사적 개선으로 분해합니다. 감각 기반 agent는 raw grids에서 raw grids를 object 중심의 scene 그래프로 변환하고, latent program policy는 다양한 DSL 프로그램을 제안하며, symbolic executor는 후보 프로그램을 demonstration에 대한 verification을 통해 검증하고, reflective agent는 다음 턴에 대한 failure-driven feedback를 제공합니다. 이러한 agent는 shared differentiable blackboard를 통해 서로 의사소통하고, learned meta controller에 의해 스케줄링됩니다. 이 설계는 구조화된 프로그램 탐색과 적응적인 다중 턴 수정을 결합하여 challenging abstract transformation 과제에서 논리 추론 효율성과 솔루션 품질을 향상시킵니다.

에이전트 7월 13일

AI가 도와주는 Lean Formalization의 전략 게임: 비라소프 방정식의 평균 필드 유도

AI 기술을 활용하여 Lean 4 증명 도우미를 통해 비라소프 방정식의 평균 필드 유도에 대한 연구 결과를 공식화했습니다. 이 게임의 목표는 LaTeX 문서를 Lean으로 변환하는 것입니다. 개발이 컴파일되며, sorry가 없으며, 기계 검증이 목표 정리만 Lean의 기초 axioms에 의존하는지 확인하면 게임이 끝납니다. 재사용은 두 번째 검증입니다. 개발이 더 넓은 라이브러리가 흡수할 수 있는 일반적인 수학의 독립된 층을 제공하는지 확인합니다.

에이전트 7월 13일

장기 목표 지표 벤치: 장기 목표 지표를 위한 분자 보상 평가를 위한 agent의 한계를 시험하는

인공지능 agent는 짧고 명확한 작업을 자율적으로 완료할 수 있게되었습니다. 그러나 현재의 종결 벤치점은 간단한 문제에 초점을 맞추고 1분 이내에 완료되며, 최종 결과만 평가하는 것이 일반적입니다. 이러한 설정은 중간 진행과 부분적인 해결책을 무시하고, 희박한 보상 신호와 agent의 능력을 완전히 이해하지 못하게 합니다. 장기 목표 지표 벤치를 통해, 우리는 9개의 카테고리 (실험 재현, 소프트웨어 공학, 멀티 모달 분석, 인터랙티브 게임, 과학적 계산)로 구성된 46개의 장기 목표 지표 작업을 소개합니다.

에이전트 7월 13일

그래프 증강 tree 검색 및 층별 월드 모델을 이용한 효율적인 agent 계획

대규모 언어 모델(LLM)-agent는 단계별 계획 작업에서 hứ부를 보여주었지만, 존재하는 접근법인 언어 에이전트 트리 서치(LATS)와 ReAct는 계획 중에 LLM 추론에 의존하여, 높은 컴퓨팅 비용과 확률적 행동을 초래한다. 우리는 GATS (그래프 증강 트리 서치)라는 계획 프레임워크를 제시한다. GATS는 체계적인 UCB1 기반 트리 서치와-layered 월드 모델을 결합하여, 추