這家中國人工智能開發商的V4.1 Flash模型採用了一種全新的“因果編碼器-解碼器”架構,該架構基於一個擁有5520億參數的框架,並採用了專家混合(MoE)設計。 DeepSeek聲稱,該模型不僅在性能上超越了其之前的旗艦產品,同時還降低了推理成本並提升了運行速度。