본문으로 건너뛰기

검색

전체 기사

연구 4월 23일

인피어런스 헤드룸 비율: 제약 하의 인피어런스 안정성에 대한 진단 및 제어 프레임워크

인피어런스 헤드룸 비율(Inference Headroom Ratio, IHR)은 제약된 의사결정 시스템의 인피어런스 안정성에 대한 진단 및 제어 프레임워크를 제공하는 차원리스 진단 양적(量的)이다. IHR는 시스템의 실제 인피어런스 용량(C)과 운영 환경이 부과하는 결합된 불확실성(U)과 제약 부하(K)의 관계를 공식화하고, 인피어런스 안정성 경계점의 근접성 대신 출력 수준 성능을 캡처하는 것을 목표로 한다. 세 가지 제어된 실험을 통해 IHR는 다음과 같이 작동한다는 것을 보여준다. 1. (1

AI 모델 4월 23일

임상시험 문헌에서 투여 오류 자동 감지: LightGBM을 사용한 다중 모드 특성 엔지니어링 접근법

임상시험 문헌에서 투여 오류 자동 감지: LightGBM을 사용한 다중 모드 특성 엔지니어링 접근법 임상시험에서는 약물 사용 프로토콜에 엄격히 따르지만 투여 오류는 여전히 환자 안전과 시험의完整성을影响하는 지속적인 도전으로 남아있다. 우리는 gradient boosting을 사용하여 comprehensive multi-modal feature engineering을 통한 unstructured clinical trial narratives에서 dosing errors를 자동 감지하는 시스템을

AI 모델 4월 23일

열역학적 논리 평가를 위한 대형 언어 모델의 3층 벤치마크: ThermoQA

열역학적 논리 평가를 위한 대형 언어 모델의 3층 벤치마크: ThermoQA 열역학 문제 293개를 3개 층으로 나누어 정의합니다: 속성 검색(110 Q), 구성 요소 분석(101 Q), 및 전체 사이클 분석(82 Q). CoolProp 7.2.0을 사용하여 물, R-134a, 및 변이 cp 공기를 다루는 그라운드 트루스는 프로그래밍적으로 계산됩니다. 여섯 대의 정교한 LLM은 각각 세 번의 독립적인 실행을 통해 평가됩니다. 합성 리더보드는 Claude Opus 4.6 (94.1%), GPT-5

AI 모델 4월 23일

AML 추계에 대한 설명 가능한 LLM 접근: 증거 검색 및 대체사례 검증

AML 추계는 대규모 언어 모델(LLM)을 이용하여 다양한 증거를 요약하고 합리화를 작성할 수 있지만, 규제된 워크플로우에서 무제한적 생성은 허구, 약한 증거, 그리고 내재된 결정에 대한 충실하지 않은 설명을 유발할 수 있다. 본 연구에서는 AML 추계를 증거 제한된 결정 과정으로 다루는 설명 가능한 AML 추계 프레임워크를 제안한다. 본 연구에서는 (i) 정책/유형 지침, 고객 맥락, 경보 트리거, 거래 서브그래프에서 증거를 추출하는 검색-augmented 증거 집합, (ii) 명시적인 인용과 지원하는 것과 반대하거나 누락된 증거를 구분하는 구조화된 LLM 출력 계약, (iii) 최소한의可能性가 있는 변동이 추계 추천과 합리화에 대한 일관된 변화를 유발하는지 검증하는 대체사례 검증을 포함한다. 본 연구에서는 공공의 합성 AML 벤치마크 및 시뮬레이터에서 평가하고 규칙, 표자 및 그래프 기반 머신러닝, LLM-only/RAG-only 변형과 비교한다. 결과는 증거 기반으로 하기 때문에 감사 가능성이 크게 향상되고 숫자 및 정책 허구 오류가 감소한다는 것을 보여주며, 대체사례 검증 또한 결정과 관련된 설명 가능성과 내구성이 더 크게 향상한다. 이 결과는 AML 추계에 대한 규제 요구 사항에 대한 충เทคโนโลย을 제공하는 지배가 가능한, 검증 가능한 LLM 시스템이 실용적인 결정 지원을 제공할 수 있음을 나타낸다.

AI 모델 4월 23일

NGSS 교실에서 과학적 설명의 자동 점수를 향상하기 위한 데이터 증강 및 재샘플링 전략

과학적 설명의 자동 점수는 즉각적인 정확한 피드백을 제공할 수 있지만, NGSS에 기반한 학습 진행에 따라서 고급 사유를 포착하는 분석 범주에서 클래스 불균형이 문제를 일으키고 있습니다. 본 연구에서는 transformer 기반 텍스트 분류 모델을 이용하여 고등학교 학생들의 물리 과학 평가에 대한 설명을 분석하는 데 있어 데이터 증강 전략을 조사했습니다. 본 연구에서는 SciBERT를 기본 모델로 사용하여 fine-tuning을 수행하고, 다음과 같은 증강 전략을 테스트했습니다: (1) GPT-4로 생성된 합성 응답, (2) EASE, 단어 수준 추출 및 필터링 기법, (3) ALP(대규모 언어 모델(LLM)으로 구현된 Augmentation using Lexicalized Probabilistic context-free grammar) 구문 수준 추출.

AI 모델 4월 23일

텍스트 임베딩을 통해 도메인 지식이 없는 알고리즘 선택

텍스트 임베딩을 통해 도메인 지식이 없는 알고리즘 선택 우리는 특수한 인스턴스 특징을 대신하여 사전 훈련된 텍스트 임베딩을 통해 알고리즘 선택 방법을 제안한다. ZeroFolio 방법을 사용하면 세 가지 단계로 진행된다: 인스턴스 파일을 평문으로 읽고, 사전 훈련된 임베딩 모델을 사용하여 임베딩을 생성하고, 가중치 k-최근 이웃 선택을 통해 알고리즘을 선택한다. 우리의 접근법의 핵심은 사전 훈련된 임베딩이 도메인 지식이나 작업에 특화된 훈련 없이도 문제 인스턴스를 구별하는 표현을 생성한다는

AI 모델 4월 23일

도구 과다 사용의 환상: LLM이 내부 지식보다 외부 도구를 선호하는 이유는 무엇인가?

대규모 언어 모델(LLM)이 내부 사고 제한을克服하기 위해 외부 도구를 사용하는 것은 효과적이지만, 이는 사고 과정에서 불필요한 도구 사용을 유발하는 새로운 현상인 도구 과다 사용을 발생시킨다. 이 현상은 다양한 LLM에서 퍼지면서, 내부 지식의 경계를 정확하게 파악하지 못하고 실제 지식 사용 가능성을 오해하는 지식적 환상(justification illusion)과, 결과만을 보상을하여 도구 사용을 과도하게 유도하는 보상 구조(reward structure)가 도구 과다 사용의 원인이다.