这家中国人工智能开发商的V4.1 Flash模型采用了一种全新的“因果编码器-解码器”架构,该架构基于一个拥有5520亿参数的框架,并采用了专家混合(MoE)设计。 DeepSeek声称,该模型不仅在性能上超越了其之前的旗舰产品,同时还降低了推理成本并提升了运行速度。