최적화만으로는 부족하다.
OpenAI가 2019년에 2백만개의 GPT-2 출력을 공개했다. 그들은 문법이 맞지 않으며 절반은 깨진 상태였다. 이것을 통해 기계가 생성한 텍스트를 감지하는 데 도움을 주었다. 그들의 더 유연한 후계자는 일반적으로 엔지니어링의 업적으로 간주되지만, 우리는 그것을 옵티미제이션 문화의最新 표현으로 읽는다: 측정 가능한 개선이 정의된 축에 따라 열차를 움직인다는 신념. 이 신념을 통해 트레이닝
1177개의 기사
OpenAI가 2019년에 2백만개의 GPT-2 출력을 공개했다. 그들은 문법이 맞지 않으며 절반은 깨진 상태였다. 이것을 통해 기계가 생성한 텍스트를 감지하는 데 도움을 주었다. 그들의 더 유연한 후계자는 일반적으로 엔지니어링의 업적으로 간주되지만, 우리는 그것을 옵티미제이션 문화의最新 표현으로 읽는다: 측정 가능한 개선이 정의된 축에 따라 열차를 움직인다는 신념. 이 신념을 통해 트레이닝
기후 조절 아이디어를 작물 실험만으로는 힘들 정도로 빠르고 대규모로 테스트할 수 있는 녹색 지상 반복 학습(Greenhouse reinforcement learning)이 있습니다. 그러나 스마트 온실 제어를 위해서 단일 시뮬레이터 반환 값만은 부족합니다. 온실 농법이나 제어 엔지니어도 온실이 과열되는지, CO2濃度를 높이는지, 공기를 내보내는지, 습도 관리를 하는지, 스크린을 배치하는지,
SQL을 작성할 수 있는 대규모 언어 모델(LLM)이 있지만, 실무 환경에서 더 많은 요건이 필요합니다. 출력 결과는 문법적으로 올바른 결과여야 하고, 역할별 및 스키마별 정책을 준수해야 하며, 증명 가능한 보증이 필요하며, 생성이 증가할수록 속도가 느려지지 않아야 하며, 모든 결정에 대한 준수도준의 기록이 남아야 합니다. 우리는 GRID(Grammar-Railed Decoding), 문법
금융 규제 기관들이 데이터 거주지 규칙을 따라 운영할 때, 기관의 경계 내에서 작동할 수 있는 Tenant-owned 언어 모델이 필요하다. 이 논문은 두 개의 관련 FAOS 연구를 하나의 기계 및 제어 문서로 합병한다. 첫 번째로, 논문은 ontology-amplified distillation의 proof-of-mechanism 연구 결과를 보고한다. Foundation AgenticOS
ICRL(인-컨텍스트 강화 학습)에서 모델의 학습 과정에 대한 연구가 재개되면서, 미리 학습된 모델이나 미리 튜닝된 결정 모델이 상호작용 콘텍스트에서 잠재적인 작업 규칙을 추론하고 향후 행동을 개선할 수 있는 능력을 연구하고 있습니다. 이 연구는 시도-오류 증거, 보상, 전이, демон스트레이션, 피드백, 또는 취득한 경험이 콘텍스트 창구 내에서 학습과 유사한 계산을 발생시키는지 여부를 물
永久 期货 시장의 시장 메이커에서 최적의 시장 메이킹을 위한 엄격한 이론적 프레임워크를 개발합니다. 시장 메이커의 문제를 필터링된 확률 공간에서 스토캐스틱 최적 제어 문제로 모델링하며, 제어는 두 개의 거래소에서 적응적인 매수 매도 스프레드와 재고 보험 결정입니다. 우리의 기여는 다음과 같습니다: (i) PnL 분해 정리 - 수익을 스프레드 수입, 부정 선택 손실, 재고 보유 비용, 보험 마
arXiv:2607.09744v1 Announce Type: new Abstract: Least privilege, the principle that an identity should hold only the permissions strictly required for its task, has been a foundational primitive of ac
대규모 언어 모델(LLM)의 전략적 경제적 추론을 향상시키는 구조화된 추론 장치의 효과를 조사하고, 그 효과가 모델 아키텍처에 따라 달라지는지 살펴보았다. 하틀링(Hotelling)의 선형 도시 모델을 진단용으로 사용하여, 표준 인도식 모델인 GPT-4.1-mini와 추론 최적화 모델인 GPT-5-mini를 5가지 조건 - 비구조화된 기초 및 4가지 추론 장치 - 에서 8가지의 유추적 추론과
자동 주행 시스템과 자율 주행 차량의 안전한 동작 계획을 위해, 주변 교통 장면이 어떻게 진화할지 정확하게 이해하는 것이 필요합니다. 그러나 대부분의 경로 변경 예측 방법은 단일 대상 차량에 집중되어 있으며, 다중 에이전트 예측 접근법은 차량의 미래 위치만을 통해 장면 진화에 대한 정보를 제한적으로 제공합니다. 이 연구에서는 다중 상호 작용 차량의 장면 수준 경로 변경 의도와 추진 예측을 위한 다이나믹 장면 그래프 주의 프레임워크를 제안합니다.
연구팀은 LLM 벤치마크 코세트 선택에 대해 연구했는데, 이는 작은 프롬프트 서브셋을 여러 벤치마크에 걸쳐 선택하여 전체 벤치마크 셋에서 얻은 모델 점수 및 순위를 근사하는 것이다. 연구팀은 평가-무 감독 벤치마크 코세트 선택 방법을 제안했는데, 이 방법은 모델 평가 결과를 사용하지 않고, 미세한 단계로 여러 벤치마크에 걸쳐 프롬프트 서브셋을 선택하는 것이다.
1996년 마우리스 파그누코(Maurice Pagnucco)가 작성한 박사 학위 논문에서 처음으로 AGM-like 추론 확장 연산을 만들었다. 파그누코의 연산을 바탕으로, Atocha Aliseda의 영감을 받은 분류체계를 사용하여 추론의 주요 구성 요소를 강조하고 공식화하는 데 사용되었다. 이 논문의 주요 목표는 추론의 주요 구성 요소를 강조하고 공식화하는 데 사용되는 분류체계를 바탕으로
연속 시간 내 피드백 연결 메모리 시스템(FCMS) 아키텍처는 네 개의 추상 연산자를 통해 폐쇄 루프 조정성을 formalize합니다. 이 중 agent update 연산자 $f_i$와 환경 업데이트 연산자 $\Psi$는 원래 프레임워크에서 axiomatically 정의되지 않습니다. 이를 해결하기 위해 $f_i$는 Mechanism-Based Intelligence (MBI)에서 정의되어 agent가 지역적으로 decentralized price mechanism과 경제 원칙을 통해 업데이트되고, $\Psi$는 Coupled Memory Graph Process (CMGP)에서 정의되어 environment가 physical substrate로 취급되고 trajectory history가 기록되고 응답되는 non-Markovian framework입니다. 이로 인해 얻은 연속 시간 FCMS 인스턴스는 computable threshold $4\beta^2 < 2\eta\mu\gamma^2$로 goverened되는 Lyapunov global dissipativity를 달성합니다. 이는 discrete FCMS stability condition $4\eta\beta^2 < \gamma$와 CMGP의 physical bifurcation threshold $\alpha_c = 1/K$를 일반화합니다. 이는 memory dissipation이 feedback gain보다 빠르게 발생해야 하는 universal organizing principle임을 확인합니다. $N=2$ agent의 numerical simulation과 $N=10^6$의 mean-field validation은 stability threshold와 self-reinforcing coordination cascade가 발생하는지 여부를 확인합니다.
자율 산업 운영을 위한 핵심 단계 중 하나는 자연어 요구 사항 명세서에서 제어 정책을 생성하고 재구성할 수 있는 능력입니다. 이 설정에서, AI agent가 제어 정책을 생성할 수 있는 가능성이 있으며, 이에 대응하는 plant-aware validator (예: 디지털 쌍둥이)가 생성된候補 액션을 실행하기 전에 검사할 수 있다면 신뢰할 수 있는 경로가 될 수 있습니다. 그러나 실제 배포는
학습된 심사관을 이용해 코드 생성기를 후처리하면, 점수를 높일 수 있는 프록시 특성만 최적화할 수 있다. 우리는 반대 신호를 연구한다: 결정론적이고 심사관이 없는, 게임할 수 없는 필터 -- 생성된 프로젝트가 비정형 엔진에서 깨끗하게 실행되는지 여부(strict-launch). 이 게이트를 통과하면, 거짓 샘플링 자기 반영(compound out-of-family generalization)
대규모 여행 판매 문제(TSP)의 정확한 해결은 계산 비용이 많이 듭니다. 연구자들은 계산 효율성을 높이기 위해 그래프 스파라시피케이션 방법을 사용합니다. 전통적인 스파라시피케이션 방법은 일반적으로 고정된 가이드라인에 의존하고, 인스턴스에 특화된 구조 정보를 완전히 활용하지 못합니다. 본 논문에서 우리는 그래프 에지 스파라시피케이션(GES) 방법을 제안합니다. 이 방법은 유계적 TSP에 대한
연구자들은 대규모 언어 모델(LLM)과 같은 모델들이 단일 목표에 집중하여 숫자로 된 계획을 만드는 것을 주로 사용하지만, 이러한 모델들이 실질적인 예산, 노력, 또는 임상 주의를 할당하는 결정을 위한 신뢰도는 실패 모드이다. 이는 모든 개체화된 숫자가 가정이며, 정확히 맞지 않는 경우에만 최적화된 계획이 약한 것이기 때문이다. YUKTI는 이러한 문제를 해결하기 위해 자동 형식화의 목표를
최근의 잠재적 추론 방법들, 예를 들어 CODI와 COCONUT는 다음과 같은 기본적인 해석성 문제를 가진다: 그들은 각 단계마다 은닉 공간에서 여러 후보 추적을 겹쳐서 유지한다. 이와는 대조적으로 명시적-CoT는 단일 투명한 추론 추적을 따른다. 현재의 기계적 방법들은 압축, 단축 및 겹침을 보여주지만, 추론이 은닉 단계를 통해 어떻게 발전하는지 설명하지 않는다. 이 간격을 해결하기 위해,
arXiv:2607.09689v1 발표 유형: 새로운 개요: 지역 아сим포틱 정상성 (LAN)의 선형 근사에서, 작업자로 하여금 chunk의 크기가 $n$인 부분 집합에 대해 신뢰도 밀도 $\exp\{-\beta E(\theta)\}$를 방출하게 되는데, 이 밀도는 고에너지 (Gibbs-Boltzmann) 측도이며, 역온도는 샘플 크기 $\beta=n$이다. 세 가지 결과는 가우스/선형 경
대규모 언어 모델(LLM) agent가 서로 정보를 전달할 때, 메시지 형식이 중요합니까? 두 개의 문헌은 서로 다른 의견을 제시한다: 형식 최적화 작업은 구조화된 메시지가 비용을 절감하면서 정확성을 손상시키지 않다고 보고하지만, 형식 제한 작업은 구조를 강요하면 생성을 손상시키고 정확성을 떨어뜨린다고 보고한다. 또한 한 번의 메시지가 여러 홉을 거치면 복사 신뢰도, 단일 홉 생성이 아닌 것
arXiv:2607.09665v1 공지 유형: 새로운 abstract 프롬프트 wrapper는 형식만 다를 뿐인데, 모델 점수가 충분히 바뀌어 랭킹 결과를 뒤집을 수 있다. 우리는 토큰을 통제한 프로토콜 아래 이 변화를 연구하고 두 가지 상보적인 지표를 도입한다: 형식敏감도 지수(FSI), wrapper 선택에 의해 유도된 정확도 범위, 그리고 파서 가능성敏감도 지수(PSI), wrapper
AI가 의학 진단에 도움을 주는 새로운 방법을 소개합니다. 투울민 논증 모델을 사용하여 의학 진단의 구조화된 평가를 제공합니다. 이 모델은 진단의 신뢰성을 높이고, 의사와 환자 간의 의사소통을 개선합니다.
물리적 인공지능 분야인 지능형工장, 창고, 서비스 로봇 등에서 다종류의 대규모 언어 모델(LLM)로 구동되는 embodied agent 팀이 널리 사용되고 있습니다. 이러한 agent 팀 간 협업을 가능하게 하기 위해 네트워크 리소스가 제한된 환경에서 안정적으로 작동하는 효율적인 협력 메커니즘이 필요합니다. 그러나 existing heterogeneous LLM-agent 협력 프레임워크가
arXiv:2607.09322v1 발표 본 연구에서는 실제 병원 기록(EHR)에 기반한 장기 시야의 의료 결정-making을 위한 LongMedBench라는 새로운 benchmark를 제시합니다. 이전에 LLM 기반 의료 agent를 평가한 연구는 주로 단기 맥락에 기반한 지식 QA와 도구 사용에 중점을 두었습니다. 그러나 실제 의료 치료는 장기적으로 진행되며, 임상가들은 반복적인 방문, 테
이 시스템 논문에서는 OpenProver라는 오픈 소스 시스템을 제시한다. 이 시스템은 대규모 언어 모델(LLM)로 구동되는 자동 정리 증명(automatic theorem proving, ATP)과 통합된 Lean 4 공식 검증을 지원한다. OpenProver는 최근 ATP agent 시스템인 Aletheia에서 영감을 받은 Planner-Worker-Verifier 아키텍처를 통합한다.