주제 · Retrieval & RAG
lab OpenAI News · 20일 전 · 조회수 35회

OpenAI, 내장 데이터와 GPT-6 Astra를 갖춘 금융 서비스용 ChatGPT 출시

OpenAI는 GPT-6 Astra의 추론 능력과 내장 프리미엄 금융 데이터를 결합한 맞춤형 경험을 제공하는 금융 서비스용 ChatGPT를 출시했습니다. 이 제품은 연구, 모델링 및 고객 자료 제작을 지원하기 위해 모건 스탠리와 에버코어와 파트너십을 맺고 개발되었으며, 투자 은행 및 주식 리서치 분야의 주요 과제를 해결하는 데 목적이 있습니다.

lab Google — The Keyword (AI) · 13일 전 · 조회수 27회

UN, 글로벌 통계를 통합하기 위해 System Data Commons 출시

UN 시스템은 Google's Data Commons 위에 구축된 오픈소스 플랫폼인 UN System Data Commons을 출시하여 AI 준비 지식 그래프로 알려진 단일 연결된 리소스로 글로벌 통계를 통합합니다. Google.org의 지원으로 이 프로젝트는 중요한 데이터에 대한 보편적 접근과 실시간 글로벌 진행 상황 추적을 목표로 합니다.

lab Cohere Blog · 3시간 전 · 조회수 1회

Cohere, Embed 5 Pro 및 Fast 임베딩 모델 출시

Cohere는 Cohere API, Microsoft Foundry 및 Amazon SageMaker에서 Pro와 Fast 등급으로 제공되는 새로운 프론티어 임베딩 모델 패밀리인 Embed 5를 출시했습니다. 두 등급은 단일 임베딩 공간을 공유하여 팀이 최대의 품질을 위해 Pro로 인덱싱하고 낮은 지연 시간과 비용을 위해 Fast로 쿼리할 수 있으며, 인덱스를 다시 구축할 필요가 없습니다.

media MarkTechPost · 7시간 전 · 조회수 4회

Perplexity가 Photon을 출시하여 검색 p99 지연 시간을 800ms에서 65ms로 단축

Perplexity는 자체 개발한 Rust 기반의 검색 및 랭킹 엔진인 Photon을 출시했으며, 이는 이제 모든 프로덕션 트래픽을 처리하며 이전에 포크된 오픈소스 구성 요소를 대체했습니다. 새로운 시스템은 Perplexity Search API에서 "Fast Search" 모드를 가능하게 하여 에이전트 워크플로우에 현저히 낮은 지연 시간을 제공합니다.

lab Hugging Face Blog · 1일 전 · 조회수 1회

ProvenanceGuard가 MCP 에이전트에 소스 인식 검증을 추가합니다

ProvenanceGuard는 Model Context Protocol (MCP) 에이전트를 위한 생성 후 검증 계층으로, 주장이 올바른 증거 소스에 귀속되도록 보장하여 교차 소스 혼동을 감지합니다. 이 시스템은 에이전트의 재학습 없이 캡처된 MCP 추적을 분석하며, 답변을 주장으로 분할하고 지원되는 소스가 출력에서 명시되거나 암시된 소스와 일치하는지 검증합니다.

arxiv arXiv cs.AI · 2일 전 · 조회수 1회

RareDx는 그래프 기반 정책 최적화를 통해 희귀 질환 진단을 개선한다

저자들은 희귀 질환 진단의 장타원 추론 문제를 해결하기 위해 통제된 증거 활용과 지식 그래프 기반 정책 최적화를 결합한 시스템인 RareDx를 소개합니다. 학습 파이프라인은 Top-10 사후 훈련과 RareDx-KGPO를 결합하며, 이는 예측을 표준 질환 그래프로 투영하고 선별된 등급 관련성, 온톨로지 근접성, 생물의학적 유사성 및 표현형 일관성을 통합합니다.

arxiv arXiv cs.AI · 3일 전 · 조회수 15회

Highlight-Then-Summarize는 증거를 압축하여 장기 문맥 이해력을 향상시킵니다

연구자들은 질문 관련 증거를 식별하고 답변을 생성하기 전에 이를 컴팩트한 요약에 통합하는 압축 후 추론 패러다임인 Highlight-Then-Summarize(H2S)를 제안합니다. 연구진은 6,647개의 예제로 구성된 H2S-Dataset을 구축하고 증거 선택에 대한 프로세스 수준 보상을 제공하는 H2S-RL을 소개합니다.

arxiv arXiv cs.CL · 3일 전 · 조회수 6회

Highlight-Then-Summarize는 더 나은 긴 문맥 이해를 위해 증거를 압축한다

연구자들은 질문 관련 증거를 식별하고 답변을 생성하기 전에 이를 압축된 요약에 통합하는 압축 후 추론 패러다임인 Highlight-Then-Summarize(H2S)를 제안했다. 이 접근 방식을 지원하기 위해 연구진은 11개 벤치마크 패밀리에서 6,647개의 예제를 포함한 H2S-Dataset을 구축하고 프로세스 수준 보상을 위한 H2S-RL을 도입했다.

arxiv arXiv cs.CL · 3일 전 · 조회수 7회

KuaFu는 수십억 규모에서 사용자 행동을 이해로 압축합니다

Tencent는 원시 사용자 기록을 대화 에이전트 및 추천 시스템용 컴팩트한 표현으로 압축하는 통합 행동 압축 레이어인 KuaFu를 소개했습니다. 이 시스템은 2축 프로젝터를 사용하여 각 행동 항목을 너비 128-256의 2-4개 토큰으로 압축하여 수십억 사용자의 긴 시퀀스 처리 병목을 해결합니다.

media Hugging Face Forums · 3일 전 · 조회수 5회

생물학적 JEPA 모델은 생물학적 제약을 사용하여 질병 진행을 모델링합니다

Biological JEJA라는 새로운 오픈소스 프로젝트는 JEPA 스타일의 표현 학습과 생물학적 제약을 결합하여 질병이 시간이 지남에 따라 어떻게 진행되는지 모델링합니다. 이 접근 방식은 2,347명의 환자로부터의 실제 ADNI 데이터로 테스트되었으며 여러 다른 모델과 비교되었습니다.

media Hugging Face Forums · 9일 전 · 조회수 14회

jbsalles, LLM을 위한 선택적 메모리 시스템 SelMem 실험

저자는 대규모 언어 모델(LLM)을 위한 불완전하고 경로 의존적인 메모리를 실험하기 위해 SelMem이라는 Rust 프로젝트를 개발했습니다. 이 접근 방식은 상호 작용의 완벽한 사본을 저장하는 대신 에이전트가 시간이 지남에 따라 기억을 압축, 잊어버리고 재구성할 수 있도록 하여 인간 기억을 모방합니다.

media Hugging Face Forums · 11일 전 · 조회수 13회

시맨틱 라우팅이 14K 컨텍스트 스트레스 테스트에서 Qwen2.5 입력 토큰을 41% 줄이고 지연 시간을 45% 단축

HotpotQA 브리지 질문에 대해 동결된 4비트 Qwen2.5-7B-Instruct를 사용한 GPU 스트레스 테스트는 작업 인식 시맨틱 라우팅이 높은 방해 조건 하에서 효율성과 정확성을 크게 향상시킨다는 것을 보여줍니다. 이 연구는 전체 제한 컨텍스트와 예산의 60%를 유지하는 쿼리 인식 시맨틱 선택자를 비교했으며, 속도와 정밀도에서 상당한 개선을 발견했습니다.