출처 · MarkTechPost
media MarkTechPost · 1일 전 OSWorld 2.0 · 72.6% · 조회수 2회

OpenAI가 dots 출시: 전용 클라우드 컴퓨터를 갖춘 지속형 GPT-6 Astra 에이전트

OpenAI는 GPT-6 Astra 모델을 기반으로 하는 지속형 AI 에이전트를 특징으로 하는 새로운 관리형 제품인 "dots"를 선보였습니다. 각 dot은 자체 전용 클라우드 컴퓨터와 브라우저에서 작동하여 ChatGPT 플러그인을 통해 4,000개 이상의 애플리케이션 간에 작업을 수행하고 사용자가 로그오프한 후에도 작업을 계속할 수 있습니다.

media MarkTechPost · 8일 전 GDPval-AA (Elo) · 1695.0Elo · 조회수 23회

SpaceXAI가 더 큰 기본 모델과 향상된 벤치마크를 갖춘 Grok 4.7 출시

SpaceXAI는 Grok 4.6보다 더 큰 기본 모델과 확장된 강화 학습 실행을 활용하는 코딩, 에이전트 작업 및 지식 작업을 위한 새로운 플래그십 모델인 Grok 4.7을 출시했습니다. 이 모델은 전작과 동일한 가격 체계를 유지하면서도 자체 검증, 긴 컨텍스트 처리 및 안전성 측면에서 향상된 기능을 제공합니다.

media MarkTechPost · 12일 전 · 조회수 35회

알리바바 Qwen이 에이전트형 올모달 모델인 Qwen3.8-Omni-Flash를 1M 컨텍스트로 출시

알리바바의 Qwen 팀은 오디오-비디오 이해와 도구 사용을 위해 에이전트 기능을 중심으로 설계된 최초의 올모달 모델인 Qwen3.8-Omni-Flash를 출시했습니다. 이 모델은 텍스트, 이미지, 오디오, 비디오 입력을 받아 텍스트 출력을 반환하며, 1M 토큰 컨텍스트 윈도우와 네이티브 함수 호출 기능을 갖추고 있습니다.

media MarkTechPost · 17일 전 · 조회수 40회

Anthropic, 임베디드 평가자를 포함한 '프런티어 속도 조절' 계획 제안

2026년 9월 12일, Anthropic CEO Dario Amodei는 AI 능력 향상 속도를 늦추도록 촉구하는 'We Must Pace the Frontier'라는 제목의 에세이를 발표했다. 이 제안에는 교육 파이프라인에 직원 수준의 접근 권한을 가진 제3자 '임베디드 평가자' 설립, 프런티어 연구소 간 안전 표준 조정, AI 제한에 대한 글로벌 합의 추진 등 세 단계 계획이 포함된다.

media MarkTechPost · 20일 전 · 조회수 55회

DeepSeek, 1M 컨텍스트와 FP4 KV 캐시를 갖춘 DeepSeek-V4.1-Flash 출시

DeepSeek AI는 100만 토큰의 컨텍스트 윈도우와 글로벌 캐시 크기를 토큰당 890바이트로 줄이는 FP4 KV 캐시를 탑재한 멀티모달 Mixture-of-Experts 모델인 DeepSeek-V4.1-Flash를 출시했습니다. 이 모델은 성능을 유지하면서 메모리 요구사항을 크게 낮추기 위해 인코더-디코더 구조와 Compressed Sparse Attention 2(CSA2)를 활용합니다.

media MarkTechPost · 27일 전 ARC-AGI 3 · 99.9% · 조회수 59회

OpenAI가 105만 토큰 컨텍스트를 갖춘 컴퓨터 사용 모델 GPT-6 Astra 출시

OpenAI는 채팅 모델이 아닌 컴퓨터 사용 시스템으로 주로 포지셔닝된 폐쇄형 호스팅 모델인 GPT-6 Astra를 출시했습니다. 이 모델은 브라우저, 스프레드시트, 터미널에서 소프트웨어를 작동하여 다단계 작업을 완료하며, 105만 토큰의 컨텍스트 윈도우와 2026년 4월 30일을 지식 컷오프로 지원합니다.

media MarkTechPost · 28일 전 · 조회수 63회

구글 딥마인드, Gemini 3.8 Flash와 게이트드 Flash Cyber 변이 출시

구글 딥마인드는 공통의 기반 아키텍처를 공유하지만 안전성 범위와 접근 제어에서 차이가 있는 두 가지 새로운 모델 변이, Gemini 3.8 Flash와 Gemini 3.8 Flash Cyber를 출시했습니다. 표준 Gemini 3.8 Flash는 Gemini API 및 기타 구글 플랫폼을 통해 일반적으로 사용 가능하지만, Cyber 변이는 Fairwind 프로그램을 통해 검증된 방어자만 제한적으로 접근할 수 있습니다.

media MarkTechPost · 29일 전 GDPval-AA (Elo) · 1853.0Elo · 조회수 53회

Anthropic, Terminal-Bench-Science에서 52.6% 점수 및 저렴한 캐시 읽기와 함께 Claude Fable 5.1 출시

Anthropic은 기반 모델은 공유하지만 안전 장치 계층이 다른 Claude Fable 5.1과 제한된 Claude Mythos 5.1을 출시했습니다. Fable 5.1은 주요 클라우드 제공업체 전반에서 일반적으로 사용 가능하지만, Mythos 5.1은 검증된 조직에만 제한적으로 제공됩니다.

media MarkTechPost · 7시간 전

NVIDIA 연구진, Cosmos 3 비디오 모델의 물리 추론 개선을 위해 Physis-Lang 공개

NVIDIA, MIT, 옥스퍼드 대학교 연구진은 captions에 자기 진화적 물리 언어를 통합하여 비디오 월드 모델을 강화하는 프레임워크인 Physis-Lang을 소개했습니다. 이 접근 방식은 물리 언어를 생성된 비디오의 물리 오류를 수정하기 위해 데이터 선별, 모델 학습 및 추론에 사용되는 최적화 가능한 표현으로 간주합니다.

media MarkTechPost · 7시간 전 · 조회수 4회

Perplexity가 Photon을 출시하여 검색 p99 지연 시간을 800ms에서 65ms로 단축

Perplexity는 자체 개발한 Rust 기반의 검색 및 랭킹 엔진인 Photon을 출시했으며, 이는 이제 모든 프로덕션 트래픽을 처리하며 이전에 포크된 오픈소스 구성 요소를 대체했습니다. 새로운 시스템은 Perplexity Search API에서 "Fast Search" 모드를 가능하게 하여 에이전트 워크플로우에 현저히 낮은 지연 시간을 제공합니다.

media MarkTechPost · 1일 전 Android World · 85.1% · 조회수 8회

H社가 데스크톱, 웹, 모바일용 Holo4 오픈 가중치 컴퓨터 사용 모델 출시

H社는 데스크톱, 웹, 안드로이드 및 API 환경에서 클릭, 입력, 코드 작성, 도구 호출을 수행하도록 설계된 범용 컴퓨터 사용 비전-언어 모델 패밀리인 Holo4를 출시했습니다. 이번 출시에는 256K 컨텍스트 창을 지원하는 두 가지 모델 크기가 포함됩니다: Holo4 27B(밀집형)와 Holo4 35B-A3B(3B 활성 파라미터를 가진 전문가 혼합 모델).

media MarkTechPost · 1일 전 SWE-bench Verified · 79.0% · 조회수 7회

Google Research, AI 에이전트 하니스 과적합 방지를 위해 RRSI 공개

Google Cloud AI Research는 UNC-Chapel Hill, 스탠퍼드 대학교, 세인트루이스 워싱턴 대학교와 협력하여 RRSI(정규화된 재귀적 자기 개선)를 오픈소스로 공개했습니다. 이 프레임워크는 모델 가중치를 변경하지 않고도 LLM 에이전트가 프롬프트, 도구, 메모리, 제어 흐름 및 하위 에이전트를 포함한 자체 하니스를 재작성할 수 있게 합니다.

media MarkTechPost · 1일 전 · 조회수 3회

알리바바 Qwen이 전이중 음성 모델인 Qwen-Audio-3.1-Realtime를 출시

알리바바의 Qwen 팀은 새로운 Qwen-Audio-3.1-Realtime-plus를 포함한 5개 모델로 구성된 오디오 스택인 Qwen-Audio-3.1을 출시했으며, 이는 추론과 도구 사용이 가능한 음성 에이전트를 위해 설계된 전이중 음성 모델입니다. 이번 출시에서는 ASR 서비스에 최대 95%의 가격 인하도 도입되었습니다.

media MarkTechPost · 2일 전 · 조회수 9회

NVIDIA가 OpenShell과 Sentry를 탑재한 오픈 에이전트 보안 플랫폼 출시

NVIDIA는 AI 에이전트 보안을 위한 개방형 소프트웨어 플랫폼인 NVIDIA Open Agent Safety Platform을 출시했으며, 이는 BlueField-4 DPU의 외부 감시 장치인 Sentry와 결합된 OpenShell 보안 런타임으로 구성됩니다. 이 시스템은 에이전트가 애플리케이션 계층 제어를 우회하는 실패 모드인 "드리프트"를 방지하기 위해 안전성 강제 조치를 에이전트의 접근 범위 밖에 배치하도록 설계되었습니다.