본문으로 건너뛰기

검색

전체 기사

에이전트 7월 27일

위험은 목표가 아니다: 연속적인 위험 신호 평가를 위한 단조성 프레임워크

위험 예측 시스템을 평가할 때 일반적인 머신 러닝 지표를 사용하는 것은 기본적으로 잘못된 것이다. 이 연구에서는 연속적인 위험 신호의 기능적 일관성보다는 이벤트 예측 정확성을 평가하는 지표를 사용하는 것이 문제라는 것을 밝혔다. 이 연구에서는 연속적인 위험 신호의 증가가 관찰된 운영 부하의 증가와 일관되게 상응하는지 측정하는 새로운 단조성 평가 프레임워크를 제안한다. 또한 프랑스 알프스-마리팀 지역에서 3가지 구조적으로 다른 접근 방식인 전문가 기반 DFE 지수, GRU 기반 예측 모델, 그리고 LLM 기반 추론을 결합한 예측 AI와 다중 에이전트 시스템 FARS를 비교한다. 실험 결과 DFE는 분류 지표가 좋지 않지만 전체 위험 범위에서 가장 균형 잡힌 단조성 행동을 나타내었고, GRU 모델은 강한 지역 단조성을 달성했지만 위험 수준이 잘 분산되지 않았다. FARS는 상류 신호의 구조적 제한을继承하고 보정하지 못했다. 이 연구의 중심 발견은 좋은 위험 모델은 정확하게 화재를 예측하지 않지만, 그 순위가 의미 있게 운영 동적을 설명하는 모델이 좋은 위험 모델이라는 것이다.

AI 모델 7월 27일

자기개선하는 agent를 위한 workflow와 실행 가능한 기술의 동시개선: FlowEvo

FlowEvo는 대규모 언어 모델(LLM) agent가 복잡한 작업을 해결하기 위해 inference-time workflow를 구성할 때 발생하는 유용한 절차를 재사용할 수 있도록 하는 training-free framework입니다. FlowEvo는 workflow와 skill의 동시개선으로 agent가 시간이 지남에 따라 task-solving 능력을 축적하고 개선할 수 있도록 합니다.