본문으로 건너뛰기

#GPT

218개의 기사

에이전트 9월 11일

AI 과학자 워크플로우 평가를 위한 프로세스 트레이스: OpenDiscoveryTrace

자율 AI 과학자들을 평가하는 현존하는 벤치마크들은 최종 출력물만 평가하고 그 출력물이 얻어진 추론 과정을 버린다. 이로 인해 과학적 방법론을 감사할 수 없으며, 실패 모드를 진단할 수 없으며, 체계적인 추론과 행운의 추측을 구별할 수 없다. 우리는 **OpenDiscoveryTrace**라는 공개 데이터셋을 제시하는데, 이 데이터셋은 558개의 완전한 AI 과학적 agent 경로를 캡처하여

에이전트 9월 10일

기억이 도움이 될 때 : 도구 사용을 위한 LLM agent의 장기 기억에 대한 비용에 대한 평가

대규모 언어 모델(LLM) agent의 장기 기억은 오늘날 대화 기록에 대한 질문에 대한 답변을 측정하는 LoCoMo, LongMemEval과 같은 회상 성능 지표로 평가된다. 이러한 지표는 기억한 사실이 도구를 사용하는 agent의 행동을 바꾸는지 여부를 측정하지 않는다. MERIT (Memory Evaluation for Realistic Instrumented Tasks)이라는 새로운

AI 모델 9월 9일

ChatGPT가 그린 그림으로 나쁜 그림을 세부적인 AI 이미지로 바꿔요

오픈아이(OpenAI)는 화요일에 ChatGPT Images 2.5를 발표했으며, 사용자가 ChatGPT에게 그림을 그려서 이미지 만들 것을 말할 수 있는 새로운 방법을 추가했습니다. 새로운 기능인 Sketch를 통해 사용자는 ChatGPT 내에서 직접 그림을 그릴 수 있고, 그다음에 사용자는 ChatGPT에게 어떻게 이미지를 만들 것인지 말할 수 있습니다.

에이전트 9월 7일

항구 어댑터와 항구 인덱스: 대규모 행위적 평가를 위한 인프라와 커스텀 메타 데이터 세트

연구자들은 최근 등장한 에이전트 평가 지표를 평가하기 위해 어려움을 겪고 있다. 이는 종종 복잡한 환경과 에이전트 통합이 필요하기 때문이다. 우리는 에이전트 평가 지표를 평가하기 위한 통합 평가 인프라인 하버 어댑터(harbor adapters)를 소개한다. 우리의 연구는 세 가지 기여를 한다. 첫 번째로, 우리는 80개 이상의 지표를 평가하기 위한 에이전트에 대한 벤치마크 어댑터(bench

AI 모델 9월 4일

채팅봇 ChatGPT, Grok, 클라우드 Claude 모두 동시에 멈췄다.

오픈아이의 ChatGPT, xAI의 Grok, 그리고 Anthropic의 Claude는 모두 목요일 같은 시간에 문제를 겪기 시작한 후에 다시 작동을 시작했습니다. 약 오전 11시 ET에 ChatGPT는 사용자가 채팅봇을 사용하려는 시도에 오류 메시지를 반환하기 시작했습니다. 그들의 상태 페이지에서는 "ChatGPT와 Codex에서 고장난 오류가 많았다"고 말했습니다. 오류로 인해 사용자가

AI 모델 8월 13일

일체형에서 모듈형으로 : 세그먼트 단위 자동 프롬프트 최적화

자동 프롬프트 최적화(Automatic Prompt Optimization, APO)는 프롬프트를 일괄적으로 수정하는 경향이 있어, 한 가지 성능이 향상되면 다른 성능이 저하될 수 있습니다. 우리는 SAPO라는 세그먼트 기반 APO 방법을 제시하고 있습니다. SAPO는 프롬프트를 역할, 문맥, 작업, 출력 형식으로 분해한 다음, 상위 5개와 하위 5개의 예제에 기반하여 대상 향상을 적용합니다

AI 모델 8월 13일

당연히 ChatGPT의 개 암 백신은 스타트업을 탄생시켰습니다.

오스트레일리아의 기술기업가가 ChatGPT, Grok 등 인공지능 도구를 이용해 개에게 맞춤형 암 백신을 개발한 이야기가 많이 언급된 적이 있지만, 놀랍게도 그는 스타트업을 창업했습니다. 이 기업가는 폴 콘인감(Paul Conyngham)입니다. 그는 "개에게 맞춤형 mRNA 암 백신을 제공하는" Gamgee라는 스타트업을 출시했다고 밝혔습니다. 하지만 그의 목표는 여기서 끝나지 않고 [..

인기 태그