产品简介
Iris 是小红书 AllSpark 团队在 2026 年 9 月 14 日开源的两款搜索智能体模型,包括 35B 的 Iris-mini 与 397B 的 Iris-pro,分别以 Qwen3.6-35B-A3B 与 Qwen3.5-397B-A17B 为基座,均支持 256K 上下文。团队把精力集中在搜索这一件事上:训练数据从网页超链接结构反向构造,种子页出链形成实体图谱后生成多跳问题,再把除答案之外的所有实体改写成描述性指代,抹掉题目里可以直接抄到的线索。
评测覆盖 BrowseComp、BrowseComp-ZH、DeepSearchQA 与 HLE 四项基准。Iris-pro 得分分别为 88.6、85.1、92.9 与 56.4,Iris-mini 为 82.2、84.8、86.9 与 52.3,其中 Iris-mini 在 BrowseComp 上的 82.2 已经接近体量大得多的模型。两个版本在各自的参数区间里都处于同类开源模型的前列。
核心功能
- 双版本覆盖不同部署预算:Iris-mini 为 35B(基座 Qwen3.6-35B-A3B),Iris-pro 为 397B(基座 Qwen3.5-397B-A17B),分别面向本地部署与追求效果上限的场景
- 反向造题的数据构造:从网页超链接结构出发构建实体图谱与多跳问题,把除答案外的实体改写为描述性指代,弱化题目中可直接抄到的线索
- 闭卷加开卷双重筛选:只保留闭卷答不出、开卷能答对且答案唯一的样本进入训练集,保证题目确实依赖检索才能完成
- SFT 与 RL 递进训练:采用 SFT 到 RL 的爬坡式训练流程,判分与摘要全部在训练集群内部完成,不依赖外部 API,超长轨迹支持断点续跑
- 256K 上下文:两个版本都支持 256K 上下文,适合需要多轮检索与长材料整合的研究型任务
- 能力外溢到通用工具调用:团队观察到搜索训练带来的收益外溢到通用工具使用与办公类评测,在 BFCL、τ-bench、OfficeQA 与 APEX 上也有提升
适合谁用
以下类型的用户会特别受益于 小红书 Iris(AllSpark):
- 需要多跳检索与来源核对的深度研究型问答
- 给现有 Agent 补上联网搜索环节,替换通用模型的默认检索行为
- 中文检索场景,BrowseComp-ZH 是其重点覆盖的基准之一
- 在本地或私有环境部署搜索智能体,35B 版本对显存更友好
- 与通用大模型搭配,由 Iris 负责检索与材料整理,由大模型负责写作与决策
优点亮点
- 两个版本同源训练,小尺寸版本在 BrowseComp 上已接近万亿参数模型的水准
- 256K 上下文覆盖长材料整合,不必频繁截断检索结果
- 训练流程把判分与摘要收进集群内部,长轨迹可断点续跑,工程上更可控
- 权重、论文与模型卡完整开源,可直接下载或按需微调
- 搜索能力的收益外溢到通用工具调用,不只是单一基准上的数字
价格与方案
模型权重以开源方式发布,可自行部署;推理成本取决于所选版本与托管平台。两种规格分别对应不同的显存与吞吐预算。
总结与建议
Iris 适合把搜索当作核心能力的团队:做深度研究型问答、给 Agent 接上可靠检索,或者需要在中文检索场景里保证答案可核对。35B 版本对本地部署更友好,397B 版本面向效果上限。如果只是偶尔需要联网问答,通用大模型的默认检索通常够用,不必为搜索单独引入一套模型。
版本演进
- 小红书 AllSpark 开源搜索智能体模型 Iris,35B 与 397B 双版本 (2026-09-14):小红书 AllSpark 团队开源搜索智能体模型家族 Iris:Iris-mini 35B(基座 Qwen3.6-35B-A3B)与 Iris-pro 397B(基座 Qwen3.5-397B-A17B),均支持 256K 上下文。四项基准成绩,Iris-pro 为 BrowseComp 88.6、BrowseComp-ZH 85.1、DeepSearchQA 92.9、HLE 56.4;Iris-mini 为 82.2、84.8、86.9、52.3,其中 BrowseComp 的 82.2 已接近万亿参数模型。数据构造从网页超链接结构反向造题,把除答案外的实体改写为描述性指代,并用闭卷答不出、开卷能答对且答案唯一做双重筛选;训练采用 SFT 到 RL 递进爬坡,判分与摘要收进训练集群内部,超长轨迹支持断点续跑。搜索能力同时外溢到 BFCL、τ-bench、OfficeQA 与 APEX 等通用工具调用与办公评测。论文 arXiv:2609.04304,权重与模型卡在 GitHub 与 Hugging Face 开源。