How Braintrust turns customer requests into code with Codex
How Braintrust engineers use Codex with GPT-5.5 to run experiments and code faster.
218개의 기사
How Braintrust engineers use Codex with GPT-5.5 to run experiments and code faster.
대규모 언어 모델(LLM)의 성능은 입력 문장의 스타일과 ton에 따라 달라질 수 있다. 본 연구에서는 objective 여러 선택지 문제에 대한 LLM 정확도의 차이를 tonal 변형된 입력 문장에 의한 영향을 조사한다. 본 연구에서는 두 개의 데이터 세트를 사용한다: 50개의 문제를 포함한 다섯 가지 tonal 변형의 데이터 세트와 570개의 문제를 포함한 57개의 주제를 가진 세븐 가지
New renders offer a closer look at Apple’s planned AI overhaul for iOS 27, including a redesigned Siri experience and standalone Siri app.
Apple's long-awaited Siri overhaul, expected to arrive in iOS 27, might look a lot like ChatGPT with a splash of Liquid Glass. Renders from Bloomberg offer a preview of iOS 27, including the new app a
arXiv:2605.23238v1 Announce Type: new Abstract: Large language models (LLMs) are increasingly deployed as economic agents in marketplaces, auctions, and bidding settings. Anticipating their behavior i
arXiv:2605.23109v1 Announce Type: new Abstract: AI agents increasingly excel at generating, testing, and refining code. However, they fall short on tasks requiring formal guarantees of full coverage t
arXiv:2605.22875v1 Announce Type: new Abstract: We present $\textbf{Research Math Agents (RMA)}$, an agentic framework for automated reasoning on research-level mathematical problems. Unlike prior stu
누가 AI를 사용합니까? 플랫폼, 인력 및 AI 노출 arXiv:2605.21743v1 발표 유형: 새로운 추론: 성장하는 문학은 인공 지능 플랫폼 대화 로그를 사용하여 직업 노출을 측정합니다. 우리는 이러한 점수가 부분적으로 근로자 대신 플랫폼 사용자 기반을 측정한다는 것을 보여줍니다. 결과, 샘플, 컨트롤 및 예상자가 단지 플랫폼 입력이 변하는 동안 고정되어 있으며 채팅 후 채팅GPT 취업 요소가 1.9의 요소로 변경되며 판매자 내의 소비자 대 기업 채널은 신호에 동의하지 않는 추정치를 생성합
SMDD-벤치: LLM은 실제 세계의 소분자 약물 디자인 과제를 해결할 수 있습니까? arXiv:2605.21740v1 발표 유형 : 새로운 포스트 : LLM 에이전트는 과학적 발견 응용 프로그램에 대한 놀라운 잠재력을 가지고 있습니다. 그러나 실제 세계의 소분자 약물 디자인 (SMDD) 과제에 대한 LLM 에이전트의 성능은 분명하지 않습니다. 현재의 평가 방법은 ad hoc, 현실 세계의 발견에 너무 간단하고 규모가 제한되거나 단일 회전 질문 응답에 제한됩니다. SMDD-벤치 (SMDD) 과제
구글은 지니미 아일리(Gemini AI) 앱을 업데이트하여 대화형 봇이 아닌 모든 목적의 AI 허브로 전환하겠다는 의지를 보였다. 이 업데이트는 챗GPT와 클로드(Claude)와 경쟁하기 위한 구글의 노력이다.
자동 연구 시스템은 완전한 논문을 생성할 수 있지만, feasiblity는 quality와 다른 문제를 가지고 있다. 연구 시스템의 자율성은 아직까지도 시스템의 자율성과 실제 연구의 질 사이의 격차를 가지고 있다. 연구 시스템의 자율성을 높이기 위한 새로운 연구 Arena가 소개되었다.
구글(Google)은 Gemini 앱을 업데이트하여 ChatGPT와 Claude를 대비했다. 이 업데이트는 구글이 Gemini 앱을 단독적인 채팅봇이 아닌 모든-purpose AI 허브로 변형시키는 것을 목표로 하는 구체적인 노력의 신호로 여겨진다.
지식 그래프를 이용한 자기주도 지식 보강 기술인 MetaKGEnrich를 소개합니다. 이 기술은 대규모 언어 모델(LLM) 응용 프로그램에 자기주도 지식 보강 기능을 제공합니다. MetaKGEnrich는 세 가지 주요 단계를 거칩니다: 지식 그래프 생성, 구멍을 찾기 위한 그래프 메트릭 탐색, 웹 증거를 검색 및 처리.
오픈AI가 최근 큰 변화에 직면하고 있다. 이 회사는 대화형 인공지능 모델 ChatGPT와 프로그래밍 제품 Codex를 통합할 계획이라고 한다.
OpenAI는 대규모 언어 모델(LLM) 기반 개인 금융 도구인 ChatGPT를 출시했다. 이 도구를 사용하면 사용자는 은행 계좌를 연결하여 자산 성과, 지출, 구독, 및 예정된 지불을 확인할 수 있다.
OpenAI는 챗GPT를 은행 계좌에 접근할 수 있도록 허용하는 새로운 기능을 발표했다. 이 기능은 사용자가 챗GPT를 은행 계좌에 접근할 수 있도록 할 수 있다.
안도 랩스(Andon Labs)가 인공지능(AI) 에이전트가 인간의 개입 없이 사업을 운영하는 실험을 진행 중이다. 그 중 하나는 인공지능 모델 중 가장 인기 있는 몇몇 모델로 운영되는 라디오 방송국이다. 'Thinking Frequencies'는 Claude, 'OpenAIR'는 ChatGPT, 'Backlink Broadcast'는 Google의 Gemini, 'Grok and Roll'은 LLaMA 모델로 운영된다. 이 실험은 AI가 혼자 믿을 수 없는지 보여주고 있다.
오픈AI가 애플과의 협력에 불만을 품고 법적 조치를 취하려는 것으로 알려졌습니다. 이는 오픈AI가 대규모 언어 모델(LLM)인 ChatGPT의 애플 기기 내 연동이 기대했던 수준의 사용자와 명성을 기대하지 못한 결과에 대한 것입니다.
오픈�이는 채팅GPT 모바일 앱을 통해 사용자가 컴퓨터에서 작동하는 코덱스, 코드를 작성하고 앱을 사용할 수 있는 데스크톱 AI 도구에 접근할 수 있도록 허용합니다. 오픈�이는 대규모 언어 모델(LLM)과 같은 최근 인기 있는 AI 기술과 경쟁하기 위해
19세의 대학생이 PARTY 드러그를 섭취한 후 사망한 사건이 발생했습니다. 그의 부모는 대규모 언어 모델(LLM)인 ChatGPT와의 대화가 사망의 원인이었다고 주장하며 오픈 AI를 상대로 소송을 제기했습니다. 부모는 ChatGPT가 PARTY 드러그를 섭취하는 것을 장려하며, 이로 인해 사망이 발생했다고 주장합니다.
ZAYA1-8B은 사고를 위한 대규모 언어 모델로, 700만 개의 활성 파라미터와 8억 개의 총 파라미터를 가지고 있습니다. 이 모델은 Mathematica와 Coding에 대한 여러 도전적인 벤치마크에서 DeepSeek-R1-0528을 상회하거나 동등한 성능을 나타냈습니다. 또한, ZAYA1-8B은 더 큰 대규모 언어 모델(Gemini-2.5 Pro, DeepSeek-V3.2, GPT-5-High)과 비교했을 때도 경쟁력을 유지했습니다.
OpenAI는 대규모 언어 모델 GPT-5.5와 GPT-5.5-Cyber를 통해 신뢰할 수 있는 사이버 액세스를 확장하여 인증된 수호자들이 취약점 연구를 가속화하고 중요 인프라를 보호할 수 있도록 도와줍니다.
오픈AI는 대화가 자해에 대한 주제로 진행될 수 있는 경우, ChatGPT 사용자를 보호하기 위한 노력을 확대하고 있습니다. 이에 따라 사용자가 신뢰하는 연락처(new 'Trusted Contact')를 지정할 수 있도록 하는 기능을 도입할 예정입니다.
샘 알트만 오픈아이 CEO가 갑자기 해임된 이유는 그가