뉴욕 타임즈 내부에서 치열한 인공지능 전쟁
미디어 업계에서는 최근 수년 동안 뉴스룸이 AI를 사용해야 하나, 사용하지 않아야 하나에 대한 논쟁이 지속되어 왔다. 이러한 규칙은 점점 더 노조와 출판사 사이의 협상 표면에서 결정되고 있다. 현재 뉴욕 타임즈의 직원들은 [...]
전체 기사
미디어 업계에서는 최근 수년 동안 뉴스룸이 AI를 사용해야 하나, 사용하지 않아야 하나에 대한 논쟁이 지속되어 왔다. 이러한 규칙은 점점 더 노조와 출판사 사이의 협상 표면에서 결정되고 있다. 현재 뉴욕 타임즈의 직원들은 [...]
오프라인 계층적 강화 학습에서 지속 가능한 스킬을 얻는 것은 여전히 열린 문제입니다. 연구팀은 지역 동적regularity를 활용하여 지역 전이와 전역 컨텍스트 간의 유사한 행동 시퀀스를 학습하여 지속 가능한 스킬을 재사용하는 데 도움을 주는 알고리즘 CARL(Contrastive Action-based Representations for Reusable Local Control)을 제안했습니다. CARL은 복잡한 인공인간 환경에서 의미 있는 스킬의 군집화를 보였고, OGBench 벤치마크에서 HIQL과 통합되었을 때 다운스트림 성능을 향상시켰습니다.
arXiv:2605.26396v1 Announce Type: new Abstract: Large multimodal models (LMMs) have rapidly advanced in perception and reasoning; however, it remains unclear whether these capabilities generalize to d
최근 연구에 따르면 대규모 언어 모델(LLM)의 중간층에서 더 강하게 인코딩되는 환각 관련 신호는 모델의 마지막 층보다 더 강하게 인코딩된다. 환각 감지에 대한 이러한 속성을 활용하기 위한 연구가 많아지고 있지만, 좋은 성능을 나타내는 층을 자동으로 선택하는 방법은 여전히 미흡하고, 이러한 목적을 위한 원리적인 방법은 아직도 부족하다. 이러한 결핍을 해결하기 위해, 우리는 여러 가설을 제시하
자율 연구 요원은 경쟁적인 해결책과 전문적인 서류를 생산하지만, 표면 수준 평가로 인식되지 않는 검증성 실패를 포함한 출력물을 생성합니다. 이는 인용이 조작된 것, 재현 불가능한 점수, 구현과 달리 메소드 설명 등입니다. 이를 해결하기 위해 세 가지 기여를 제시합니다. 첫째, Chain-of-Evidence(증거 chain, CoE)라는 검증성 프레임워크입니다. 이는 모든 주장을 증거 소스로
교육용 시뮬레이션 실험실은 실제 실험실 시설에 한계가 있는 학생들에게 실험 훈련을 더 확장적이고 적응적이며 접근 가능하게 할 수 있습니다. 그러나 새로운 시뮬레이션 실험 절차를 작성하는 것은 여전히 비용이 많이 들 수 있습니다: 교육자들은 새로운 장비를 설명해야 하며, 장치와 재료 간의 상호작용을 정의해야 하며, virtu-al 환경 내에서 실행하거나 평가할 수 있는 유효한 절차 흐름을 지정
작업대시보드(JobBench)는 전문가들이 우선순위로 위임하기로 결정한 업무 흐름을 평가하는 새로운 지표입니다. 이는 GDP 가치 대신 인간의 필요에 따라 인간을 대체하는 대신 강화하는 방식으로 AI agent를 평가하는 것입니다.
마인드 리딩(Theory of Mind, ToM)이라는 것은 다른 사람의 지식, 의도, 감정 등을 추측하는 능력을 의미하는데, 이 능력을 대규모 언어 모델(LLM)에서 평가하는 데에는 종점 질문에 대한 답변을 통해 평가한다. 이 방식은 모델이 실제로 강력한 논리를 위해 필요한 내재된 정신 상태 표현을 구성하고 있는지 여부를 가려주고, 다른 사람의 의견이 달라지는, 변화하는, 또는 잘못된 의견
AI agent가 중요한, 장기적인 기업 업무 작업을 완료하기 시작했지만, 기업용 작업을 위한 훈련 및 평가 환경은 현실성, 검증 가능성, 규모를 균형있게 유지하는 데 어려움을 겪고 있다. 환경 및 작업 생성이 자주 artifact drift라는 실패 모드에 걸린다. 즉, 약하게 연결된 프로세스에서 지시문, 환경, 오라클, 검증기는 자주 작업이 필요한 것을について 동의하지 못하고, 불해결 가
이 논문은 과학 워크플로우를 위한 자율적이고 주체적인 인공지능(AI)을 개발하기 위한 두 가지 새로운 프레임워크를 상세히 설명합니다. 두 시스템 모두 구글 콜라브(Google Colab)를 통해 Hybrid Local Body, Remote Brain 아키텍처를 사용하여, 파이썬 기반의 지역 오케스트레이터를 사용하여 대규모 언어 모델(LLM) 클라우드 백엔드에 호출합니다. 첫 번째 agent
인공지능(AI) agent가 장기적으로 운영되면서 운영 시스템으로 사용되면서, 여전히 초기화된 모델처럼 평가되고 있다. 첫 번째 운영일(day-one) 기준점은 시스템의 기본적인 질문을 놓치고 있다. 그 질문은 agent가 배포된 후 얼마 동안 신뢰할 수 있는 상태를 유지하는지다. 모델의 가중치가 고정되어 있어도, agent의 실제 상태는 계속해서 변하고 있다. 이는 agent가 상호 작용
현재 도메인 지식 artifact에서 수학적 프로그래밍 모델(model)로의 제약 학습(Constraint Acquisition, CA) 및 관련 연구는 충분한 기준점의 부족으로 제한되고 있습니다. 이러한 결함은 재현성과 연구간 비교의 어려움으로 CA 방법의 성숙을 늦추고 있습니다. 기존의 기준점은 솔버 평가를 위한 것이었지만 CA 알고리즘을 평가하기 위한 것이었습니다. 또한 기준점은 구체적