当前位置: 首页 > news >正文

突发!DeepSeek刚刚开源V3.1-Base

今天凌晨,全球著名大模型开源平台DeepSeek开源了Deepseek V3.1-Base版本。

非常低调没有任何介绍,只是把模型放上去了。但在Hugging Face的趋势榜单中已经上升到第4名,还是相当受欢迎的。

开源地址:https://huggingface.co/deepseek-ai/DeepSeek-V3.1-Base/tree/main

Hugging Face联合创始人Clement Delangue特意发了推文祝贺,他表示,Deepseek V3.1 已经悄无声息地发布,没有附带模型卡片,却已登上 Hugging Face 趋势榜第四位,太有意思了。

这就是在 Hugging Face 上拥有 8 万名关注者的力量。

根据网友的推测,新升级版本,速度更快、智能程度更高,可与GPT级模型媲美。该模型拥有 6850 亿参数,支持 BF16、F8_E4M3、F32三种张量类型,以Safetensors格式发布,便于高效推理,还具备扩展的上下文窗口。

同时非常欣赏DeepSeek这种 “先放权重,后补说明”的风格,能让社区能够优先开展模型探索。

很高兴看到仍有公司在发布基础模型。

它应该是一个结合了 v3 和 r1 的模型。其对话模板包含一个思考参数,用于控制思考过程。

我试着在我的 4GB 显卡上加载新的 DeepSeek-V3.1-Base 685B 模型,结果它崩溃了,不知道为啥?

那近期R2还会有希望吗?

http://www.dtcms.com/a/340880.html

相关文章:

  • UTF-8 编解码可视化分析
  • 【Day 30】Linux-SQL语句
  • C/C++ 与嵌入式岗位常见笔试题详解
  • MYSQL为什么会发生死锁,怎么解决
  • 第三阶段数据-3:数据库脚本生成,备份与还原,分离与附加
  • configtx通道配置文件
  • RHCA08内存管理
  • 对称加密算法
  • 数据库DML语言(增、删、改)
  • 闪电赋能全链路:领码SPARK一体化创新平台
  • 基于HTTP3的WebTransport实践
  • 基于 Java 和 MySQL 的精品课程网站
  • 在完全没有无线网络(Wi-Fi)和移动网络(蜂窝数据)的环境下,使用安卓平板,通过USB数据线(而不是Wi-Fi)来控制电脑(版本2)
  • Ubuntu 重连usb设备(断电和不断电方案)亲测可行
  • 亚马逊新品爆单策略:从传统困境到智能突破
  • LeetCode热题100--101. 对称二叉树--简单
  • C++ 力扣 438.找到字符串中所有字母异位词 题解 优选算法 滑动窗口 每日一题
  • 《数据之舞》
  • GitHub宕机生存指南:从应急协作到高可用架构设计
  • QT-图像灰度处理时QImage.setPixel方法存在的坑
  • 在QT中动态生成控件造成界面卡顿时的鼠标处理
  • Qt设置软件使用期限【新版防修改系统时间】
  • 一个 WPF 文档和工具窗口布局容器
  • GitHub宕机应急指南:无缝协作方案
  • Eclipse 里Mybatis的xml的头部报错
  • 软考高级--系统架构设计师--案例分析真题解析
  • Java项目基本流程(五)
  • DeepSeek API 申请与 Node.js 对接指南
  • 服务器硬件电路设计之 SPI 问答(一):解密 SPI—— 从定义到核心特性
  • 服务器硬件电路设计之 SPI 问答(三):SPI 信号完整性守护与时钟频率的硬件设计羁绊