Công nghệ

DeepSeek V4.1 Flash: 552 tỷ tham số, 8 tỷ hoạt động, bộ nhớ đệm rẻ hơn 60% và ngang bằng Opus 5

Adrian Kessler

DeepSeek V4.1 Flash vận hành trên một kiến trúc mới mà công ty gọi là Causal Encoder-Decoder. Với 552 tỷ tham số trải dài trên 20 tầng encoder và 20 tầng decoder, nhưng chỉ 8 tỷ được kích hoạt trên các token đầu vào và 16 tỷ trên đầu ra. Điều đó khiến nó gọn nhẹ hơn về mặt cấu trúc so với các mô hình kích hoạt các lát tham số lớn hơn cho mọi thao tác — một lựa chọn thiết kế mang lại lợi ích trực tiếp về chi phí suy luận và hiệu quả bộ nhớ.

Lợi ích về bộ nhớ rất cụ thể. Bộ nhớ đệm KV của V4.1 Flash nằm ở mức 890 byte mỗi token, khoảng một phần tư so với V4-Flash. Bộ nhớ đệm FP4 và Compressed Sparse Attention 2 đẩy dung lượng bộ nhớ đệm thường trực xuống còn một phần tám so với thế hệ trước. Đầu vào được lưu trong bộ nhớ đệm hiện có giá 0,003 đô la mỗi triệu token vào giờ thấp điểm — giảm 60% so với V4-Flash. Đầu vào không được lưu trong bộ nhớ đệm giảm 33%, đầu ra giảm 11%.

Trên các điểm chuẩn mà nhà phát triển theo dõi nhiều nhất, mô hình tự tin khẳng định vị thế. DeepSWE v1.1 — bài kiểm tra kỹ thuật phần mềm tự động — đạt 74,2, nhỉnh hơn một chút so với Opus 5 của Anthropic ở mức 74,0 và cao hơn GPT-5.6 Sol ở mức 73,0. GPQA Diamond đạt 90,9. Khoảng cách nổi bật là Terminal-Bench 3.0: 30,0 so với 43,3 của Opus 5, một khác biệt thực sự trong các tác vụ yêu cầu gỡ lỗi tương tác kéo dài.

Khả năng thị giác được tích hợp ngay từ giai đoạn tiền huấn luyện. Trước đây, V4 tách thị giác thành một biến thể riêng là Vision-Exp. V4.1 Flash thay thế cả hai bằng một mô hình duy nhất được xây dựng xoay quanh DeepSeek-ViT, một bộ mã hóa được huấn luyện có mục đích, đồng phát triển với mô hình ngôn ngữ ngay từ đầu. Tầng đa phương thức đã biến mất — mọi lệnh gọi đều mặc định có khả năng thị giác.

Cửa sổ ngữ cảnh là 1 triệu token với đầu ra giới hạn ở 384.000, đủ để phân tích tài liệu dài và quy trình tác vụ kéo dài mà không cần chia nhỏ. Các lệnh gọi API hiện tại sử dụng ID deepseek-v4-flash và deepseek-v4-flash-vision-exp cũ đã được chuyển hướng sang V4.1 Flash. Vào ngày 14 tháng 9, lưu lượng truy cập của DeepSeek V4 Pro cũng được chuyển đổi — với mức giá của Flash.

DeepSeek mô tả V4.1 Flash là “mô hình nhỏ nhất trong họ kiến trúc mới của chúng tôi.” Một phiên bản V4.1 Pro lớn hơn trên cùng thiết kế Causal Encoder-Decoder được ngụ ý. Nếu nó duy trì quỹ đạo hiệu quả của Flash, nó sẽ mở rộng hiệu suất trên mỗi đô la của kiến trúc này xa hơn trên đường cong điểm chuẩn — vào lãnh địa hiện do các mô hình có chi phí cao hơn đáng kể trên mỗi triệu token nắm giữ.

Điểm kiến trúc quan trọng hơn cả bảng giá. Sự tăng trưởng của bộ nhớ đệm KV là một ràng buộc chính trong việc chạy các mô hình lớn với ngữ cảnh dài, và nó mở rộng theo mọi token được xử lý. Cách tiếp cận của V4.1 Flash — ít tham số kích hoạt hơn, bộ nhớ đệm nén — giải quyết trực tiếp ràng buộc đó. Đây là một khuôn mẫu khả dụng cho các triển khai ngữ cảnh dài, không phải là tối ưu hóa cho trường hợp ngoại lệ.

Thẻ: , , , , ,

Thảo luận

Có 0 bình luận.