LLM이 문맥을 이해할 수 있는가? 지식 그래프 기반 평가 프레임워크
대규모 언어 모델(LLMs)가 언어 능력에 대해 놀라운 성과를 보인 것은 사실이지만, 그 모델의 심장에 깊이 있는 질문 하나가 남아 있다: 이러한 모델들이 정말로 문맥을 이해하거나 단순히 무려 대규모 패턴 매칭에만 능통한 것일까? 대규모 언어 모델에서 문맥 이해는 주어진 문맥에서 관련 정보를 정확하게 추출하고, 그것을 일관된 내부 표현으로 통합하고, 그 문맥을 바탕으로 사실적이고 문맥적으로 지지되는 답변을 생성할 수 있는 능력을 말한다. 그러나 BLEU나 perplexity와 같은 전통적인 방법들은 단순히 표면 수준의 성과만 측정한다. 이는 QA에서 답변들이 문맥적으로 지지된 것일 뿐만 아니라 단순히 기억된 연관만 있는 것일 뿐이라는 중요한 лакูน을 드러낸다. 이 공백을 채우기 위해, 우리는 QA에서 LLM의 문맥 이해를 위한 대규모 언어 모델의 새로운 지식 그래프(KG) 기반 평가 프레임워크를 제안한다. 이 중심에는 Semantic Structural Similarity for KGs(S3KG)라는 구조적 및 의미적 신호를 결합한 단일 점수 기반의 새로운 유사도 측정 방법이 있다. 또한, 이 모델의 실패를 fine-grained하게 분석하기 위해 트리플렛 단위의 추론 오류를 식별하고 분류하기 위한 진단 분석 프레임워크를 개발했다. 이 두 가지를 합친 결과, 9개의 벤치마크에서 S3KG는 최강 baseline보다 F1 점수에서 $+7.6$점 이상의 향상을 달성하고 AUROC는 $0.973$까지 높아졌다.
함께 읽으면 좋은 기사
링그의 AI-agent가 OpenAI를 통해 고객 문의의 65% 이상을 해결합니다.
Ringg는 GPT-5.6을 사용하여 음성, 채팅, WhatsApp, 웹 등 다국어 에이전트를 90% 비용이 덜 들이는 GPT-4.1보다 운영합니다.
인비디오, GPT-6 Astra를 통해 3배 향상된 컬러 그레이딩
인비디오는 GPT-6 Astra를 통해 편집 계획을 더 정확하게 짤 수 있으며, 컬러 교정과 그레이딩을 3배 향상시켰습니다. 또한 1일 동안 50개의 커스텀 효과를 생성할 수 있습니다. 대규모 언어 모델(LLM) 기술을 활용하여 컬러 그레이딩을 개선하는 방안에 대해 알아보겠습니다.
하비가 GPT-6 아스트라와 함께 법적 맥락을 강화한 판본으로 변환합니다.
GPT-6 아스트라는 더 구조화된 맥락에 대한 법적 문서를 생성하며, 변호사들은 전략에 집중할 수 있게 해줍니다.
노이즈가 있는 경찰 음성 데이터에 대한 미리 학습된 ASR 가짜 레이블링
방송 경찰 통신(Broadcast Police Communication, BPC)에서 노이즈가 많은 상황에서 훈련된 음성 인식 시스템이 나쁜 성능을 보인다. 이를 통해 경찰의 의사 결정이 이해될 수 없게 되고, 이는 경찰의 의사 결정에 대한 연구를 어렵게 만든다. 사용자 레이블을 비용이 많이 들지 않고 pseudo-labeling을 통해 ASR 성능을 개선할 수 있는 방법이 있다. 그러나 매
단백질 확산 모델의 테스트 시점 정렬을 위한 스펙트럴 피드백
Reward 최적화와 일치하는 방법을 위한 분산 확산 모델의 방법론은 대개 역과정의 방향을 조절하기 위해 로짓을 영향받거나 중간 단계에서 선호하는 시퀀스를 선택하는 것을 목표로 합니다. 이러한 접근법은 주로 추론을 단방향적인 과정으로 다루며, 불쾌한 토큰 선택을 재방문하는 메커니즘을 제공하지 못합니다. 우리는 Spectral Feedback 라는 알고리즘을 소개합니다. 이 알고리즘은 feed
3차원 구조 기반의 막통합 단백질의 상위 구조 예측
이 논문은 최신 그래프 신경망(GNN, Graph Neural Network)인 SchNet을 이용한 단백질拓종 추론의 새로운 방법을 제시한다. 모델은 최근 DeepTMHMM 모델을 개발하기 위해 사용된 데이터셋과 동일한 데이터셋을 사용하여 5-분할 교차 검증을 통해 학습되었다. 단백질 서열이나 $\alpha$- 탄소만을 특성으로 사용하는 전통적인 접근법과 달리, 우리는 분류기에서 모든 원자
관련 콘텐츠 더 보기
다른 플랫폼에서 이 주제에 대한 더 많은 정보를 확인하세요.