본문으로 건너뛰기

검색

전체 기사

AI 모델 4월 24일

인비트로 비전: 대규모 AI 모델로 Embryo 개발 자동화 설명

인비트로 비전(InVitroVision)은 자연어로 Embryo 개발 자동화 설명을 위한 다중 모드 AI 모델입니다. 연구팀은 IVF 데이터의 다중 모드 특성을 활용하지 않고 주로 주석이 된 데이터에 의존하는 AI를 개선하기 위해 연구를 진행했습니다. 연구팀은 공개된 Embryo 시간 라프스 데이터를 사용하여 PaliGemma-2라는 다중 모드 비전-언어 모델을 1,000장의 이미지와 해당 캡션으로만 fine-tuning했습니다. 결과적으로 비전-언어 모델은 Embryo 형태학, 발생 세포 주기 및 발달 단계를 설명하는 자연어 캡션을 예측할 수 있었습니다. 연구 결과, fine-tuning된 모델 인 인비트로 비전(InVitroVision)은 상업용 모델인 ChatGPT 5.2과 기본 모델보다 성능이 우수했습니다. 또한 더 큰 훈련 데이터셋을 사용할수록 성능이 향상되었습니다. 이 연구는 대규모 언어 모델(LLM)에서 IVF 작업에 일반화할 수 있는 근본적인 비전-언어 모델의 잠재력을 보여주었습니다.

AI 모델 4월 24일

의사란 누구의 정의인가? 대상을 기반으로 한 지시어 가이드를 통한 인구학적 대표성 향상

공정성은 누구의 정의인가? 대상을 기반으로 한 지시어 가이드를 통한 인구학적 대표성 향상. 최근 연구에 따르면, 이미지 생성 AI 모델은 사회적 편견을 반영하는 경향이 있으며, 특정 직업을 나타내는 지시어를 입력할 때, 더 밝은 피부색의 출력이 나타나고, 낮은 사회적 지위의 직업을 나타내는 지시어를 입력할 때, 더 다양한 피부색의 출력이 나타나며, 편견을 해소하기 위한 기존의 방법은 모델을 재학습하거나 커스텀된 데이터셋을 사용하여야 하므로, 대다수의 사용자가 접근할 수 없는 문제를 나타낸다.

AI 모델 4월 24일

가상 공간에서 전자 의료 기록 모델링을 위한 Hyperbolic Efficient Question Answering

가상 공간에서 전자 의료 기록 모델링을 위한 Hyperbolic Efficient Question Answering(arXiv:2604.21027v1) 발표 전자 의료 기록(EHR) 질문 답변은 대규모 언어 모델(LLM)-기반 파이프라인으로 처리되지만 이는 배포하기 어려우며 의료 데이터의 계층적 구조를 명시적으로 활용하지 않는다. 의료 온톨로지와 환자 경로가 초월적 기하학을 보여주고 있다는 증거에 의해 мотив화되면서, 우리는 Lorentzian 모델인 HypEHR를 제안한다. HypEHR는

연구 4월 24일

AI가 금융 투자 연구를 위한 전문적인 연구 성과를 평가하는 'Deep FinResearch Bench' 개발

Deep FinResearch Bench는 금융 투자 연구를 위한 AI 연구 성과를 평가하는 새로운 프레임워크입니다. 이 프레임워크는 연구 보고서의 질을 평가하는 3가지 차원으로 나누어보고, AI가 금융 전문가의 보고서와 비교하여.NonNullAI가 금융 투자 연구를 위한 전문적인 연구 성과를 평가하는 'Deep FinResearch Bench' 개발

에이전트 4월 24일

마지막으로 बन낼 수 있는 Harness

인공지능(AI) 에이전트가 점점 더 복잡한 도메인에 특화된 워크플로우에서 배치되고 있다. 이 워크플로우는企業의 웹 애플리케이션을 탐색하고, 데이터를 추출하고, 합성하는 다단계 연구 파이프라인, 익숙하지 않은 저장소에서 코드 리뷰를 자동화하는 등 여러 가지 작업을 포함한다. 고객의 심각한 도메인 지식이 요구되는 고객의 프로세스 전환을 처리하는 등. \textbf{각각의 새로운 작업 도메인은 번거로운 전문가 주도적인 인프라 엔지니어링이 필요하다}: 작업을 수행하는 데 필요한 프롬프트, 도구, 오케스트

에이전트 4월 24일

장기 보수를 위한 LLM 의사결정 및 기술 은행 에이전트의 공동 진화

장기 보수를 위한 환경은 에이전트의 기술 사용 능력을 평가하는 데 적합한 테스트베드입니다. 이러한 환경은 다단계 논리 reasoning, 여러 스텝에 걸친 기술 연쇄, 지연 보상 및 부분 관찰 가능성 하에서 안정적인 의사결정을 요구합니다. 게임은 에이전트의 기술 사용을 평가하는 데 적합한 테스트베드입니다. 대규모 언어 모델(LLM)은 게임 플레이 에이전트로 유망한 대안을 제공하지만, 장기 보수 의사결정에 대한 일관된 성능을 달성하기 어렵습니다. 이는 에이전트가 에피소드 간에 구조화된 기술을 발견, 보존, 재사용하는 메커니즘을 갖고 있지 않기 때문입니다. 저자는 COSPLAY라는 공동 진화 프레임워크를 제안합니다. 이 프레임워크는 LLM 의사결정 에이전트가 기술 은행에서 기술을 검색하여 행동을 취하는 동안, 에이전트 관리 기술 파이프라인이 에이전트의 unlabeled rollouts에서 재사용 가능한 기술을 발견하여 기술 은행을 형성합니다. 이 프레임워크는 에이전트의 기술 검색 및 행동 생성 능력을 향상시키는 동시에, 기술 은행 에이전트가 기술과 그 계약과 함께 지속적으로 추출, 정제, 업데이트합니다.

AI 모델 4월 24일

규칙에 묶인 AI를 벗어나기: 정당성 신호를 통한 규칙에 따른 AI 평가

규칙에 따른 환경에서 AI 평가를 위해 기존의 동의도 측정법은 실패한다. 다중 결정을 논리적으로 일치시키는 정책에 따라 여러 판단이 가능하고, 동의도 지표는 유효한 판단을 처벌하며 모호성을 오류로 오인하는 '동의도 лов'에 빠진다. 본 연구에서는 평가를 정책에 기반한 정확성으로 formalize하고 정당성 지수(DI)와 모호성 지수(AI)를 도입한다. 또한, 추가적인 감사 패스를 필요로 하지 않고 사유 안정성을 추정하기 위해 확률 정당성 신호(PDS)를 도입한다. 본 연구에서는 LLM 사유 추적을 통한 통치 신호를 분류 출력이 아닌 통치 규칙 계층에서 논리적으로 유도할 수 있는 제안된 결정을 확인하는 감사 모델로 배치한다. 본 연구에서는 193,000+ Reddit 관리 결정을 포함한 다수의 커뮤니티와 평가 집단에서 framework를 검증하고, 동의도 기반과 정책에 기반한 지표 간 33-46.6%의 격차를 발견한다. 또한, 본 연구에서는 79.8-80.6%의 모델의 거짓 음성은 정책에 기반한 결정이 아닌 진정한 오류에 해당한다는 것을 발견한다. 본 연구에서는 37,286개의 동일한 결정을 3개 단계의 동일한 커뮤니티 규칙 하에서 감사함으로써 AI를 10.8% 감소시키는 반면 DI는 안정적임을 발견한다. 반복 샘플링 분석에 따르면 PDS의 분산은 통치 모호성에 의해 주로 결정되는 것으로 나타났다. 통치 게이트를 통해 이러한 신호를 빌려 78.6%의 자동화 커버리지와 64.9%의 위험 감소를 달성한다. 본 연구는 규칙에 따른 환경에서 평가를 동의도와의 비교 대신 사유에 기반한 유효성으로 전환해야 함을 보여준다.

연구 4월 24일

미래 전쟁에서 자동화된 작전과정 생성 시스템의 설계

미래 전쟁에서 작전과정 계획을 자동화하는 시스템은 필수적인 요소입니다. 전투 속도가 증가하고 감시 범위가 확장되고 무기 사거리가 길어지면서 전투 영역이 확대되면서, 전통적인 인력 기반 작전과정 계획이 점점 더 어려워지고 있습니다. 따라서 AI 기반 자동화된 작전과정 계획 시스템의 개발이 점점 더 필요해지고 있습니다. 따라서 여러 국가와 방위 기관은 AI 기반 작전과정 계획 시스템을 개발하고 있습니다. 그러나 보안 제한과 공개 제한으로 인해 이러한 시스템의 기술 성숙도는 평가하기 어려울 뿐만 아니라, 이러한 시스템은 군사 관련이기 때문에 공개되지 않아 현재 개발 수준을 정확하게 평가하기가 어려울 뿐입니다. 이러한 문제를 해결하기 위해, 이 연구는 공개 가능한 정보 범위 내의 관련 도덕을 소개하고 각 단계의 작전과정 계획 과정에 적용할 수 있는 AI 기술을 제안합니다. 궁극적으로, 자동화된 작전과정 계획 시스템 개발을 위한 설계를 제안합니다.