본문으로 건너뛰기

검색

전체 기사

AI 모델 4월 17일

지구 관측 위성 스케줄을 미리 알 수 없는 운영 제약조건 하에서 최적화하기: 능동 제약 조건 취득 접근법

지구 관측 위성 스케줄을 미리 알 수 없는 운영 제약조건 하에서 최적화하기: 능동 제약 조건 취득 접근법 지구 관측 위성 스케줄링(관측할 Imaging 작업을 결정하고 언제 수행할지)은 잘 연구된 조합 최적화 문제이다. 현재의 방법들은 일반적으로 운영 제약 모델이 미리 완전히 지정된 것으로 가정한다. 그러나 실제로 관측 간의 분리, 전력 예산 및 열 한계를 규정하는 제약은 명시적인 수학적 모델 대신 엔지니어링 장치나 고밀도 시뮬레이터에 내장되어 있다. 우리는 \emph{미지의 제약 조건} 하에서

LLM PC 4월 17일

숫자적 불안정성과 혼돈: 대규모 언어 모델의 불확실성을 측정하는 방법

대규모 언어 모델(LLM)의 불확실성은 숫자적 불안정성으로 인해 증가하는 에이전트 워크플로우에 통합되는 과정에서 중요한 신뢰성 문제로 등장했습니다. 최근 연구에서는 이러한 불안정성의 유의미한 다운스트림 효과를 보여주었지만, 근본 원인과 내재된 메커니즘은 아직 잘 이해되지 않았습니다. 이 논문에서는 Transformer 계산 레이어를 통해 반올림 오류가 propagate, 증폭, 또는 소진되는 과정을 추적하여, 부동소수점 표현의 유한 숫자 정밀도에 기초한 불확실성의 근본 원인을 엄격하게 분석했습니다. 특히, 초기 레이어에서 혼돈적인 '폭발 효과'를 식별했습니다. 여기서 작은 변동이 이진 결과를 트리거합니다: EITHER 빠른 증폭 또는 완전한 억제. 특정 오류 인스턴스 이외에, 대규모 언어 모델(LLM)은 세 가지 DISTINCT 영역에 의해 특징지어진 UNIVERSAL, 스케일 의존적 혼돈 행동을 보여주었습니다. 1) 안정 영역: 입력에 의존하는 임계값 이하의 변동이 발생하여 사라지며, 일정한 출력이 결과됩니다. 2) 혼돈 영역: 반올림 오류가 주도적이며 출력 분포를 유도합니다. 3) 신호 주도 영역: 실제 입력 변동이 숫자 잡음에 의해 압도됩니다. 이 발견은 다중 데이터 세트 및 모델 아키텍처에서 광범위하게 검증되었습니다.

에이전트 4월 17일

탐험과 착취 오류는 언어 모델 에이전트에 대해 측정할 수 있습니다.

언어 모델(LM) 에이전트는 이제 복잡한 개방형 의사 결정 과제에서 사용되고 있습니다. 이 에이전트는 문제 공간을 탐험하고 획득한 지식을 효과적으로 착취할 수 있어야 합니다. 그러나 에이전트의 내부 정책에 접근하지 못하는 경우 관찰된 행동으로부터 탐험과 착취를 구별하고 양을 측정하는 것은 어려울 수 있습니다. 따라서 우리는 실제로 사용되는 에이전트의 시나리오를 영감으로 한 제어 가능한 환경을 설계했습니다. 이 환경은 부분적으로 관찰 가능한 2D 그리드 맵과 알려지지 않은 태스크 Directed Acyclic Graph(DAG)로 구성됩니다. 맵 생성은 탐험 또는 착취의 어려움을 강조하기 위해 프로그래밍적으로 조정할 수 있습니다. 에이전트의 행동으로부터 탐험과 착취 오류를 측정하기 위해 우리는 정책에 대한 평가를 허용하기 위해 메트릭을 설계했습니다. 우리는 다양한 프론티어 LM 에이전트를 평가하고, 심지어 최신 모델도 이 과제에서 어려움을 겪고, 다른 모델이 각기 다른 실패 모드를 나타내는 것을 발견했습니다. 우리는 또한 논리 모델이 이 과제를 더 효과적으로 해결하고, 탐험과 착취가 최소한의 해쉬 엔지니어링으로 크게 개선될 수 있음을 관찰했습니다. 우리는 코드를 \href{https://github.com/jjj-madison/measurable-explore-exploit}{여기}에서 릴리스했습니다.

AI 모델 4월 16일

기업 AI를 운영 계층으로 다루기

기업의 인공지능(AI) 운영에는 심각한 문제가 존재하는데, 이 문제는 주목을 받지 못하고 있다. 일반인들은 기초 모델(foundation models)과 기준점(benchmarks)에 집중하는 대중적인 논의를 계속하고 있다. 예를 들어, GPT와 Gemini의 비교, 추론 점수, 그리고微妙한 기능 향상에 대한 논의가 계속되고 있다. 그러나 실제 운영 환경에서 더 중요한 것은 구조적인 장점이다. 즉, 지능을 적용하고, 통제하고, 개선하는 운영 계층을谁가 소유하고 있는지에 대한 문제다.