본문으로 건너뛰기

검색

전체 기사

LLM PC 6월 3일

무조건 진행하는 에이전트? '안하고 있는 게 옳다'를 생각해 보라

인공지능 에이전트를 평가하는 기준은 주로 목표를 달성했는지 여부에 집중한다. 하지만 이 기준은 에이전트가 안전하게 행동할 수 있는 조건이 충족되었는지 여부를 고려하지 않는다. 에이전트는 인간의 feedback을 기반으로 학습하여, 조건이 충족되지 않았을 때도 진행하는 경향이 있다. 이를 '충성도 편향(compliance bias)'이라고 한다. 연구팀은 이 문제를 해결하기 위해 abstention-warranted scenario(안하고 있어야 하는 상황)의 세 가지 분류를 제시하고, abstention-aware 에이전트를 평가하는 새로운 지표를 제안한다.

AI 모델 6월 3일

치의보건에서 대형 인공지능 모델: 일반 용도 시스템부터 도메인 특화 기본 모델까지

구강 질환은 전 세계 3.5억 명에게 영향을 미치지만 치과 분야에서 대규모 인공지능 모델의 상대적 임상 가능성은 아직 잘 이해되지 않았다. 세 가지 모델 카테고리가 나타났는데, 언어 생성 모델, 판별적 비전 기초 모델, 치과 특화 기초 모델로, 이들 간의 관계와 함께한 한계를 조사하는 통합적인 리뷰는 존재하지 않는다. PubMed, Google Scholar, Scopus, arXiv를 포함

에이전트 6월 3일

코딩 에이전트가 중단된 작업을 대신 수행할 때 발생하는 재발견 비용: 인터럽트된 작업을 처리하는 에이전트의 부담

arXiv:2606.02875v1 발표 종류: 새로운 요약: 코딩_AGENT_평가 지표는 단 하나의 연속된_AGENT가 레포지토리 문제를 해결할 수 있는지 여부를 평가한다. 실제 소프트웨어 작업은 더 복잡하다: 작업은 중단, 재assign, 검토, 다른_AGENT 또는 엔지니어의 partial 상태에서 재개된다. 우리는 이 누락된 dimension을 통해 _handoff_debt를 연구한다:

에이전트 6월 3일

도움하는 것이 해를 끼치는 경우와 해결 방법: 다중-agent 논쟁을 위한 데이터 청소

다중_AGENT_ 토론이 데이터 청소에 도움이 되는지 hurt하는지 언제인지 알아보았습니다. 세 가지 벤치마크, 네 가지 모델 종류, 그리고 6,000 여 개의 태스크-조건 pair를 조사한 결과, 토론의 효과가 반전되었습니다. 모든 네 가지 모델 (-1.6에서 -15.5pp)에서 토론이 생성을 나쁘게 만드는 반면, 오류 감지를 개선했습니다 (+27.4pp F1, d=1.0). 토론의 이점

에이전트 6월 3일

에지에서 작동하는 임베디드 AI agent 시스템을 위한 모듈식 아키텍처 방향

대규모 언어 모델(LLM)의 발전으로 인해 복잡한 추론과 도구 사용이 가능한 인공지능이 가능해졌지만, 퍼지 컴퓨팅 환경에서 이러한 자율성을 배포하는 것은 임베디드 마이크로컨트롤러의 엄격한 메모리와 에너지 제약으로 인해 어려움을 겪고 있습니다. 기존의 프레임워크는 일반적으로 서버급 자원이나 지속적인 연결성을 가정하기 때문에, 심층 임베디드 시스템을 위한_gap이 남아 있습니다. 이 논문은 결정

AI 모델 6월 3일

해결책보다 생각하기: 큰 추론 모델에서 해로운 과도한 생각 평가

대규모 추론 모델(LLM)은 더 많은 테스트 시간 컴퓨팅을 통해 명시적인 중간 추론 트레이스 생성으로 성능을 향상시키나, 더 dài한 추론이 항상 유리한지 여부는 여전히 충분히 검토되지 않은 상태이다. 최근 연구 결과에 따르면 추가적인 추론이 모델이 과도하게 생각하는 것을 유도할 수 있음을 보여주지만, 우리는 다음과 같은 질문을 던진다: "모델이 올바른 답을 찾으면, 더 많은 추론이 솔루션을

연구 6월 3일

충돌 기반 적 형태 생성 탐구

PCG(Procedure Content Generation) 분야에서 게임 내 적을 위한 콘텐츠 생성에 대한 연구는 많은 연구가 진행되었지만, 적의 형태(morphology) 생성에 대한 연구는 거의 없다고 할 수 있다. 적의 형태는 게임 내 적의 기본적인 몸 구조 및 충돌 정보를 의미한다. 이는 로봇 분야의 형태 생성 연구와 관련이 있다. 이 논문에서는 플레이어 충돌 정보를 기반으로 적의

에이전트 6월 3일

성장하는 환자 경로 모델을 위한 환자 호흡기 암 초기 검출을 위한 자기 진화하는 다중 agent 시스템: Traj-Evolve

전자 의료 기록(EHRs)에서 환자 경로를 모델링하는 데는 장기적이고 다중 모드의 시차가 심하고 노이즈가 많은 시퀀스를 처리하는 것이 필요하다. 기존의 대규모 언어 모델(LLM) 기반의 다중-agent 시스템은 컨텍스트 길이를 처리하지만 환자를 고립시켜 클리닉이 누적된 경험을 활용하는 것처럼 동일한 이전 사례에서 정보를 통합하는 것을 실패했다. Traj-Evolve는 두 가지 상호 보완적인

AI 모델 6월 3일

전자 의료 기록 표현을 대형 언어 모델과 일치시키기 위한 건강한 임상 판단의 기초

대규모 언어 모델(LLM)은 의료 결정 지원을 위한 강력한 자연어 논리 능력을 보이지만, 구조화된 장기 전자 의료 기록(EHR)의 효과적인 모델링에 어려움을 겪습니다. 반면, EHR 기반 모델은 예측 가능한 환자 표현을 학습할 수 있지만, 해석 가능한 언어 기반 논리를 제공하지 못합니다. 이 격차를 해결하기 위해, 우리는 구조화된 EHR 표현과 프리트레인된 LLM의 의미 공간을 연결하는 작업

AI 모델 6월 3일

행동트레이스에서 실제 사용자 결정을 모델링하는 행동벤치

Decision-support 시스템은 사용자별로 적응할 수 있어야 하는데, 이 문제를 위한 평가 데이터는 여전히 제한적이다. 사용자 이해를 위한 기존 벤치마크는 주로 시뮬레이션된 사용자나 모델이 생성한 행동에 의존한다. 하지만 최근 연구는 모델 기반 시뮬레이션의 경우 인간 행동과 체계적으로 다르다고 경고한다. 우리는 \textsc{BehaviorBench}라는 사용자별 의사결정 모델링을 평

AI 모델 6월 3일

무측정 유역에서의 예측을 위한 트랜스포머와 LSTM 프레임워크의 평가

물리학적 연구 결과입니다. 물의 흐름을 예측하는 연구에서, LSTM(LSTM: Long Short-Term Memory)은 트랜스포머 모델보다 성능이 좋았습니다. 물 흐름의 정보가 충분하지 않은 상황에서 LSTM은 물의 흐름을 예측하는 업스트림(streamflow inference)에서 트랜스포머 모델보다 더 좋은 성능을 보여주었습니다. 트랜스포머 모델은 업스트림 정보만 사용했을 때, LST