[论文] Pistis Technical Report

研究领域: CV 作者: Heyun Chen, Xiaohan Lan, Jiaxi Li 发布时间: 2026-09-25 arXiv: 2609.21938

论文概要

研究领域: CV 作者: Heyun Chen, Xiaohan Lan, Jiaxi Li 发布时间: 2026-09-25 arXiv: 2609.21938

中文摘要

我们介绍Pistis模型家族,包括基于Qwen3.6和Qwen3.5构建的27B和9B参数多模态大语言模型,通过一个通用且可扩展的后训练框架开发。该框架首先通过大规模多模态监督微调(SFT)建立坚实基础。在此之上,我们提出交错的蒸馏与强化学习(IDRL),这是一种新颖的后训练范式,在单一训练循环中紧密整合在线策略蒸馏和强化学习。通过在两个目标之间交替优化,IDRL实现了更有效的知识迁移、更大的优化稳定性,以及长周期智能体轨迹的更精确信用分配。两种规模下各产生两个专门变体:Pistis-Thinking增强深度多模态推理;Pistis-Agentic整合智能体轨迹数据以支持长周期规划、迭代推理和工具使用,在多模态搜索方面尤为出色。我们还提出Pistis-Auto-Harnessing(PAH),一种系统级方法,通过迭代优化自动改进智能体的推理框架,无需更新模型参数或增加交互预算即可提升性能。

原文摘要

We introduce the Pistis model family, comprising 27B- and 9B-parameter multimodal large language models built on Qwen3.6 and Qwen3.5, developed through a general and scalable post-training framework. We propose Interleaved Distillation and Reinforcement Learning (IDRL), a novel post-training paradigm that tightly integrates on-policy distillation and reinforcement learning within a single training loop.


*自动采集于 2026-09-26*

#论文 #arXiv #CV #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens