DeepSeek, 네이티브 멀티모달 지원을 갖춘 V4.1-Flash 모델 출시
DeepSeek는 새로운 아키텍처 패밀리의 가장 작은 구성원이며 네이티브 멀티모달 시각 이해 기능을 갖춘 DeepSeek-V4.1-Flash 모델을 공식적으로 출시했습니다. 이 새로운 아키텍처는 더 높은 능력 한계, 더 빠른 추론 속도, 더 높은 처리량 및 더 큰 모델에 대한 더 나은 확장 가능성을 제공하도록 설계되었습니다.
DeepSeek는 새로운 아키텍처 패밀리의 가장 작은 구성원이며 네이티브 멀티모달 시각 이해 기능을 갖춘 DeepSeek-V4.1-Flash 모델을 공식적으로 출시했습니다. 이 새로운 아키텍처는 더 높은 능력 한계, 더 빠른 추론 속도, 더 높은 처리량 및 더 큰 모델에 대한 더 나은 확장 가능성을 제공하도록 설계되었습니다.
DeepSeek는 극한의 추론 효율성과 낮은 비용을 위해 설계된 새로운 오픈 가중치 플래그십 모델인 V4.1-Flash를 출시했습니다. 이 모델은 활성화된 컴퓨팅과 KV/캐시 비용을 크게 줄이기 위해 인과적 인코더-디코더 아키텍처를 활용합니다.
DeepSeek는 새로운 오픈 웨이트 플래그십 모델인 DeepSeek v4.1-Flash를 출시했으며, 이는 추론 효율성을 극대화하고 비용을 줄이기 위해 설계된 새로운 인과적 인코더-디코더 아키텍처를 특징으로 합니다.
DeepSeek AI는 100만 토큰의 컨텍스트 윈도우와 글로벌 캐시 크기를 토큰당 890바이트로 줄이는 FP4 KV 캐시를 탑재한 멀티모달 Mixture-of-Experts 모델인 DeepSeek-V4.1-Flash를 출시했습니다. 이 모델은 성능을 유지하면서 메모리 요구사항을 크게 낮추기 위해 인코더-디코더 구조와 Compressed Sparse Attention 2(CSA2)를 활용합니다.
DeepSeek 는 Huawei 의 Ascend 950 하드웨어를 사용하여 모델을 학습하고 있습니다. 이 변화는 26 개월 전에 Liang Wenfeng 이 최전선에 나설 필요가 있다고 발표한 성명에 이어진 것입니다.
중국 규제 기관은 미국 기업 Anthropic로의 잠재적 데이터 유출과 관련하여 DeepSeek 및 Moonshot AI를 조사하고 있습니다. 이 조사는 Kimi 임원들과 관련된 루머에 이어진 것이지만, 현재 상황은 확인된 체포보다는 조사 단계로 설명되고 있습니다.
DeepSeek는 현재 2조 개의 파라미터를 가진 새로운 모델을 학습 중이며, 결국 8조 개의 파라미터를 가진 모델을 구축할 계획입니다.
연구자들은 오픈소스 코드베이스에 구현된 기능을 사용하여 소스 코드를 유일한 입력으로 강화학습 환경을 구축하는 에이전트 파이프라인인 CodeMidas를 소개했습니다. 이 방법은 기능 탐색, 실행 기반 테스트 구축, 반복 롤아웃을 통한 작업 검증을 위해 에이전트 컴퓨팅을 할당하며, 그 결과 23개 프로그래밍 언어에 걸쳐 5,545개의 학습 작업 데이터셋이 생성됩니다. GRPO를 사용하여 이러한 작업에서 MiMo-V2.5를 훈련하면 DeepSWE (+11.7%), ProgramBench (+17%), Terminal-Bench v2.1 (+8.5%) 등 다양한 벤치마크에서 성능이 향상됩니다. 궤적 분석에 따르면 RL로 훈련된 에이전트는 코드베이스 탐색 증가 및 더 다양한 자기 검증과 같은 더 나은 행동을 보이는 것으로 나타났습니다. 이러한 결과는 소스 코드가 다양한 소프트웨어 작업에서 코딩 에이전트를 개선하는 RL 환경을 구축하기 위한 확장 가능한 기반임을 입증합니다.
DeepSeek는 에이전트 워크로드에서 긴 컨텍스트 계산과 큰 KV 캐시의 높은 비용을 해결하도록 설계된 멀티모달 Mixture-of-Experts 모델인 DeepSeek-V4.1-Flash를 출시했습니다.
Atria Dawn Preview는 도구 매개 상호작용을 실행 가능 환경에 연결하는 검증 가능한 경험 파이프라인을 통해 학습된 과학 연구 및 엔지니어링 워크플로우를 위해 설계된 기반 에이전트 언어 모델입니다. 실제 연구, 엔지니어링 및 디지털 작업을 아우르는 16개 벤치마크에서 이 모델은 최첨단 에이전트들과 경쟁력 있으며, 그중 5개에서 최고 보고 점수를 달성했습니다.
DeepSeek V4.1 Flash가 Artificial Analysis Intelligence Index v4.3 업데이트의 새로운 Astra 벤치마크에서 1위를 차지했습니다.
한 사용자가 DeepSeek V4.1 모델을 NVIDIA A100 GPU에서 공식 API를 초과하는 성능으로 실행할 수 있는 사용자 지정 구현을 개발했습니다.
LiveBench 벤치마킹 플랫폼이 평가 스위트에 DeepSeek v4.1 Flash 모델을 추가했습니다.
DeepSeek V4.1 Flash 모델이 이제 HuggingChat 플랫폼을 통해 접근 가능합니다.
한 사용자가 새로 출시된 DeepSeek V4.1 Flash 모델을 사용하여 생성한 동영상을 게시하여 모션 비디오 합성에서의 능력을 벤치마킹했습니다.
DeepSeek이 새로운 모델 DeepSeek V4-1 Flash을 출시했습니다. 이는 5520억 파라미터의 백본을 갖춘 멀티모달 Mixture-of-Experts (MoE) 모델입니다.
DeepSeek는 네이티브 멀티모달 시각적 이해 기능을 갖춘 새로운 아키텍처 시리즈의 가장 작은 구성 요소인 DeepSeek V4.1 Flash 모델을 공식적으로 출시했습니다. Causal-Encoder-Decoder 설계에 기반한 이 모델은 552B 파라미터를 가진 Mixture of Experts (MoE) 모델로, 입력 측에서는 8B 파라미터만 활성화되고 출력 측에서는 16B가 활성화됩니다.
DeepSeek가 DeepSeek V4 Pro 모델을 소프트 리타이어했습니다. 이 조치는 해당 AI 시스템의 특정 버전 제공 종료를 의미합니다.
DeepSeek는 이제 API를 통해 사용할 수 있는 DeepSeek V4.1 Flash 모델의 중간 버전의 내부 베타 테스트를 시작했습니다.