본문으로 건너뛰기
LLM PC 6월 15일

강화학습 기반 트랜스포머 메서드: 개방 공장 생산 계획 문제 해결

인공 뉴스 기사 : arXiv:2606.13682v1 주제 : 개방점검이 스케줄링 문제 개요 : 개방점검이 스케줄링 문제는 많은 산업 및 서비스 환경에서 발생하지만 작업과 기계의 수가 증가함에 따라 계산적으로도 어려운 문제이다. 정확한 방법은 빠르게 불가능한 반면, 기존의 배포 규칙과 메타 휴리스틱은 대규모 스케일에서 해의 품질을 유지하기 위해 많은 조정을 필요로 한다. 이 연구에서는 OSS

LLM PC 6월 12일

LLM에서 매개변수 도구 지식 감사에 대한 진단 Framework: ToolSense

대규모 언어 모델(LLM)을 대량 도구 카탈로그에 적용하여 도구 검색을 수행할 때, 중요한 도구 검색 병목 현상이 발생한다. 임베딩 기반 검색 접근 방식은 특화된 도구 의미를 충분히 포착하지 못하는 짧은 인코더를 사용하기 때문에, 파라메트릭 도구 검색은 이 문제를 해결하기 위해 LLM 사전에 도구를 가상 토큰으로 추가하여, 두 단계의 훈련(기억 단계 및 검색 단계(SFT))을 통해 LLM을

LLM PC 6월 11일

미래 행동 예측을 학습 과제로 보다

인공지능 시스템에 대한 신뢰는 시스템이 어떻게 작동하는지 설명을 통해 종종 기반을 두고, 설명을 통해 새로운 입력에 대한 시스템의 행동을 예측한다. 그러나 대규모 추론 모델(LLM)에서 이 전통적인 경로는 특히 추론 단위 하나의 생성에 대한 설명 방법이 자연스럽게 장거리 경로로 일반화되지 않으며, 경로 자체가 자연어로 읽히면 종종 신뢰할 수 없는 경우가 많다. 따라서 우리는 설명 단계를 생략

LLM PC 6월 10일

감각부터 결정을 내리는 과정: 다중 모드 LLM에서 청각과 시각 인식 정보 흐름

멀티모달 대규모 언어 모델(Multimodal Large Language Models, MLLMs)은 들을 수 있고 보이도록 만들 수 있지만, 실제로 음성과 시각적 신호가 어떻게 네트워크를 통해 답변을 형성하는지 알기 어렵습니다. 연구와 실세계 응용에서 그 역할이 점점 커지면서도, 음성과 시각적 토큰이 최종 예측에 어떤 영향을 미치는지에 대한 내부 경로가 아직까지도 잘 이해되지 않은 상태입니

LLM PC 6월 9일

이해 구조 계층이 붕괴하는 곳 : 추론 언어 모델의 오류 진단 및 수리

인공지능이 수행하는 workflow에서 언어 모델은 지시 명령의 계층 구조를 따르도록 되어야 한다. 즉, 다른 출처로부터 온 지시 명령이 충돌할 때 모델은 가장 높은 권한을 가진 지시 명령을 따르야 한다. 현재의 벤치마크들은 대부분 이 행동을 종단에서 종단으로 측정하여, 최종 응답이 준수하는지 여부를 확인한다. 그러나 준수하지 않은 응답은 여러 가지 다른 실패로 발생할 수 있다. 예를 들어,

LLM PC 6월 9일

알츠하이머 환자의 질병 경로 재구성 및 예측을 위한 자원 제한된 환경에서 일상 데이터를 이용한 접근

알츠하이머 병은 진행성 신경퇴행성 장애로, 환자의 진행은 크게 다르다. 기존 연구에서는 환자의 미래认知 상태를 예측하는 것을 목표로 하지만, 과거 방문에서 상태를 재구성하는 것에 대한 집중은 적다. 또한, 현재 연구에서는 예측 불확실성을 양적화하는 것에 대한 연구가 부족하며, MRI, PET, CSF 등의 비용이 많이 들며 제한적인 모달리티에 의존하여, 이들 모달리티를 자원 제한적인 환경에서

LLM PC 6월 5일

TSFMs에서 inference 시간에 대한 문맥 최적화: GITCO(게이티드 인피어런스 타임 컨텍스트 최적화)

대규모 시계열 모델(TSFM, Time Series Foundation Models)의 경우, 구조적으로 이상한 패치가 과도한 주의를 받고, zero-shot 예측 품질이 침체 상태에 빠지게 된다. 이에 따라 모델의 정확성을 inference 시에 개선하기 위해, 모델의 가중치를 수정하는 대신 입력 컨텍스트를 최적화하는 방법을 제안한다. Gate, Router, Critic로 구성된 가벼운

LLM PC 6월 5일

agent가 말해야 할 것: 효율적인 다중 agent 시스템을 위한 액션-상태 커뮤니케이션

대규모 언어 모델을 기반으로 하는 다중 agent 시스템(MAS)은 일반적으로 역할, pipe라인, 그리고 턴 스케줄을 중심으로 구성되며, agent 들이 서로 주고받는 내용은 자유 형태의 자연 언어로 남겨진다. 그러나 이러한 자유로운 의사소통 방식은 token 사용량을 급격하게 증가시키고, 공유된 컨텍스트 윈도우를 소모하며, 궁극적으로 시스템 성능과 추론 비용에 영향을 미친다. 우리는 두

LLM PC 6월 4일

일반주의적 agent가 데이터 큐레이션을 자동화할 수 있나요?

현대 인공지능 개발에서 데이터를 준비하는 것은 가장 중요한데도 노동력이 많이 필요한 부분이다: 전문가들은 반복적으로 제안, 구현, 평가, 데이터 정책을 수정하는 과정을 거친다. 이러한 노이즈가 있는 벤치마크 feedback에 대해. 우리는 일반적인 코딩 agent가 이 데이터 준비 loop를 자동화할 수 있는지 여부를 묻는다. 우리는 *Curation-Bench*라는 agent-centric

LLM PC 6월 4일

비주얼-어시스트드 매트릭스 문제 해결 벤치마크

arXiv:2606.04244v1 - 새로운 발표 요약: 다중 모드 대규모 언어 모델은 복잡한 추론 능력을 보유하고 있지만, 그들은 일반적으로 도구를 통해 문제를 외부화하고 도구의 출력을 바탕으로 추론할 때 성능이 저하되는 경향이 있다. 특히, 시각적 도움을 의존할 때 그렇다. 이 괴리는 실제 엔지니어링 및 과학적 워크플로가 분석, 유효성 검사 및 의사 결정에 시각화 도구를 의존하기 때문이다

LLM PC 6월 3일

무조건 진행하는 에이전트? '안하고 있는 게 옳다'를 생각해 보라

인공지능 에이전트를 평가하는 기준은 주로 목표를 달성했는지 여부에 집중한다. 하지만 이 기준은 에이전트가 안전하게 행동할 수 있는 조건이 충족되었는지 여부를 고려하지 않는다. 에이전트는 인간의 feedback을 기반으로 학습하여, 조건이 충족되지 않았을 때도 진행하는 경향이 있다. 이를 '충성도 편향(compliance bias)'이라고 한다. 연구팀은 이 문제를 해결하기 위해 abstention-warranted scenario(안하고 있어야 하는 상황)의 세 가지 분류를 제시하고, abstention-aware 에이전트를 평가하는 새로운 지표를 제안한다.

LLM PC 6월 2일

다형 인공지능 agent 프레임워크: solid mechanics 문제를 위한 종단-종단 유한요소 분석을 위한

FEA는 Solid Mechanics에서 가장 중요한 수치적 접근 방식입니다. FEA의 어려움에는 초급 사용자에게 큰 학습 곡선과 simulation의 주요 구성 요소, 예를 들어 경계 조건, 부하 사례 및 해결 변수의 잘못된 정의로 인한 잠재적인 오류 시뮬레이션을 포함합니다. 실세계 문제 해결을 위해 일반적으로 몇 년 동안의 엔지니어링 경험 필요합니다. 이러한 문제를 해결하기 위해, 우리는

LLM PC 5월 29일

모델이 서로 다르면: 공개 댓글 분석을 위한 LLM 평가의 재고

정부 기관들은 대규모 언어 모델(LLMs)을 이용하여 공공 의견 데이터베이스를 분류하고 있다. 이 모델의 분류 방식은 정책 결정자들이 어떤 의견을 보고 어떤 논리를 인정하는지에 영향을 미친다. 현재 사용되고 있는 평가 방식은, 작은 수의 검증된 데이터와 비교하여 입장 정확도에 기반을 두고 있다. 이 평가 방식은 같은 공공 의견에 대해 다른 모델이 다르게 분류하는 것을 감지하지 못한다. 우리는

LLM PC 5월 29일

다중 모드_AGENT 프레임워크: 엔드 투 엔드 자동 유한 요소 분석

유한 요소 분석(FEA)은 현대 공학 설계의 기초를 담당하지만, 워크플로우는 복잡하고 전문 지식에 의존한다. 최근 연구에서는 대규모 언어 모델(LLM)을 유한 요소 분석에 통합했지만, 기존 접근법은 다중 모드 입력을 처리하고 복잡한 작업을 수행하는 데 제한이 있다. 이러한 제한을 해결하기 위해, 우리는 VFEAgent라는 엔드 투 엔드 다중 Agent 시스템을 제안한다. 이 시스템은 입력 이미지를 포함한 다중 모드 입력과 문제 설명을 통해 유한 요소 모델링과 시뮬레이션을 자동화한다. 시스템의 주요 구성 요소는 다중 모드 비전-언어 다중 Agent PIPELINE과 확인-first 코드 합성 프레임워크이다. 시스템은 다양한 공학 역학 시나리오에서 평가되었으며, 결과는 VFEAgent가 높은 성공률로 완전하고 물리적으로 유효한 시뮬레이션을 생성하며, LLM 기반 기본 메서드보다 신뢰성과 정확성을 뛰어난 성능을 보여준다. 이러한 결과는 엔드 투 엔드 유한 요소 분석 워크플로우의 자동화를 가능하게 하며, 엔지니어들이 번거로운 수동 분석에서 해방되도록 하는 프레임워크의 잠재력을 강조한다.

LLM PC 5월 27일

LLMs가 자각할 수 있을까? 현실 점검

대규모 언어 모델(LLM)이 내부 상태를 감지하고 보고할 수 있는지 여부에 대한 연구가 여러 차례 진행되었지만, 이러한 결론이 미리 맏기기에 지나치다고 생각합니다. 인간의 자기 인식 연구에서 배운 교훈을 바탕으로, 내부 상태를 진정하게 인식하는 것과 표면적인 자극에 기반한 패턴 매칭을 구별하는 것은 필수적이라고 생각합니다. 또한 단지 행동적 증거만으로는 강력한 자기 인식 주장을establis