Tema · Retrieval & RAG
lab OpenAI News · há 20 d · 35 visualizações

OpenAI apresenta ChatGPT para Serviços Financeiros com dados integrados e GPT-6 Astra

A OpenAI lançou o ChatGPT para Serviços Financeiros, uma experiência personalizada que combina o raciocínio do GPT-6 Astra com dados financeiros premium integrados para auxiliar equipes em pesquisa, modelagem e criação de materiais para clientes. O produto foi desenvolvido em parceria com a Morgan Stanley e a Evercore para enfrentar desafios-chave no setor de bancos de investimento e análise de ações.

lab Google — The Keyword (AI) · há 13 d · 27 visualizações

ONU lança o System Data Commons para unificar estatísticas globais

O sistema da ONU está lançando o UN System Data Commons, uma plataforma de código aberto construída sobre o Google's Data Commons que une as estatísticas globais em um único recurso interconectado conhecido como grafo de conhecimento pronto para IA. Com o apoio do Google.org, o projeto visa tornar os dados críticos universalmente acessíveis e ajudar a acompanhar o progresso global em tempo real.

media MarkTechPost · há 7 h · 4 visualizações

Perplexity lança Photon, reduzindo latência p99 de recuperação de 800 ms para 65 ms

A Perplexity lançou o Photon, um mecanismo de recuperação e classificação interno baseado em Rust que agora gerencia todo o tráfego de produção, substituindo um componente open-source anteriormente bifurcado. O novo sistema permite um modo de "Busca Rápida" na API de Busca da Perplexity, oferecendo latência significativamente menor para fluxos de trabalho agênticos.

lab Hugging Face Blog · há 1 d · 1 visualização

ProvenanceGuard adiciona verificação consciente da fonte a agentes MCP

O ProvenanceGuard é uma camada de verificação pós-geração para agentes do Model Context Protocol (MCP) que detecta a confluência entre fontes distintas, garantindo que as afirmações sejam atribuídas à fonte de evidência correta. O sistema analisa os rastros MCP capturados sem retreinar o agente, dividindo as respostas em afirmações e verificando se a fonte de suporte corresponde àquela nomeada ou implícita na saída.

arxiv arXiv cs.AI · há 1 d · 1 visualização

RareDx usa otimização de política baseada em grafos para melhorar o diagnóstico de doenças raras

Os autores apresentam o RareDx, um sistema que acopla o uso controlado de evidências com otimização de política fundamentada em grafos de conhecimento para abordar o problema de raciocínio de cauda longa no diagnóstico de doenças raras. O pipeline de treinamento combina Top-10 pós-treinamento com RareDx-KGPO, que projeta previsões em um grafo canônico de doenças e integra relevância graduada curada, proximidade ontológica, similaridade biomédica e consistência fenotípica.

arxiv arXiv cs.AI · há 3 d · 15 visualizações

Highlight-Then-Summarize comprime evidências para melhorar a compreensão de contexto longo

Pesquisadores propõem o Highlight-Then-Summarize (H2S), um paradigma de compressão seguida de raciocínio que identifica evidências relevantes à pergunta e as integra em um resumo compacto antes de gerar uma resposta. A equipe constrói o H2S-Dataset com 6.647 exemplos e introduz o H2S-RL para fornecer recompensas em nível de processo para a seleção de evidências.

arxiv arXiv cs.CL · há 3 d · 6 visualizações

Highlight-Then-Summarize comprime evidências para melhor compreensão de contexto longo

Pesquisadores propõem o Highlight-Then-Summarize (H2S), um paradigma de compressão-então-raciocínio que identifica evidências relevantes à pergunta e as integra em um resumo compacto antes de gerar uma resposta. Para apoiar essa abordagem, a equipe construiu o H2S-Dataset com 6.647 exemplos de 11 famílias de benchmarks e introduziu o H2S-RL para recompensas em nível de processo.

arxiv arXiv cs.CL · há 3 d · 7 visualizações

KuaFu comprime o comportamento do usuário em compreensão em escala de bilhões

A Tencent apresenta o KuaFu, uma camada unificada de compressão de comportamento que condensa o histórico bruto do usuário em representações compactas para agentes conversacionais e recomendadores. O sistema usa um projetor de dois eixos para comprimir cada item de comportamento em 2-4 tokens de largura 128-256, abordando gargalos no processamento de sequências longas para um bilhão de usuários.

media Hugging Face Forums · há 11 d · 13 visualizações

Roteamento semântico reduz em 41% os tokens de entrada do Qwen2.5 e a latência em 45% no teste de estresse com contexto de 14K

Um teste de estresse de GPU usando o modelo congelado Qwen2.5-7B-Instruct em 4 bits nas perguntas de ponte do HotpotQA demonstra que o roteamento semântico consciente da tarefa melhora significativamente a eficiência e a precisão sob condições com alto número de distratores. O estudo comparou o contexto completo limitado contra um seletor semântico consciente da consulta, que retém 60% do orçamento, revelando ganhos substanciais em velocidade e precisão.