AI工具导航

百川智能是什么?Baichuan-M4、百小医、医疗 API 与证据边界

百川智能当前医疗产品包括百小医、医疗模型API与Baichuan-M4、M3等研究线,旧开源Baichuan2则是不同产品。本文依据官方页面、论文、HealthBench与医疗治理指南,解释型号关系、榜单和幻觉率的证据边界,并给出个人使用、开发接入和医院采购核对清单。

百川智能医疗产品地图区分百小医、医疗API、M4和M3研究线以及Baichuan2历史开源权重
本页目录
  1. 先纠正旧稿:公司宣传、融资新闻和临床证据不是一回事
  2. 百川智能现在有哪些与医疗相关的入口
  3. M4、M3、M2 和 Baichuan 2 的关系
  4. “HealthBench 第一”和“3.3% 幻觉率”应该怎样读
  5. 个人用户:百小医适合做什么,不适合做什么
  6. 开发者:接入医疗 API 前先做五项确认
  7. 医院采购:不要购买“模型名”,要验收一个明确用途
  8. 隐私与条款:上传前要看“数据之后去哪”
  9. 三个常见选择场景
  10. 只想理解自己的报告或准备就医
  11. 要给健康应用增加问答功能
  12. 医院准备采购或试点
  13. 怎样自己复核一条百川模型宣传
  14. 本地评测不要只复制公共榜单
  15. 常见问题
  16. Baichuan-M4 已经开放 API 了吗?
  17. 百小医可以替代医生吗?
  18. HealthBench 分数高,能说明医疗水平更好吗?
  19. 3.3% 幻觉率是不是等于 96.7% 诊断准确率?
  20. Baichuan 2 开源模型能否本地搭成医疗系统?
  21. 免费医疗 API 是否值得优先采用?
  22. 一页核对清单

直接答案:百川智能是一家 2023 年成立的大模型公司,当前公开重点已经从早期通用模型扩展到医疗模型与健康助手。普通用户面对的是“百小医”,开发者和机构可查看医疗模型 API,研究者则会看到 Baichuan-M4、M3、M2、M1 等论文或模型资料;2023 年的 Baichuan 2 开源权重属于另一条历史产品线。它们不能混称为同一个产品,更不能因为论文或榜单分数较高,就直接推断可以替代医生、自动诊断或在医院无验证上线。

百川智能医疗产品地图区分百小医、医疗API、M4和M3研究线以及Baichuan2历史开源权重
先分清入口、服务和模型代际,再比较能力。百小医、托管 API、研究论文与旧开源权重解决的是不同任务。图:兰塞 AI 编辑部原创。

医疗提示:本文用于产品识别、证据解读和采购前核对,不提供个人诊断、处方或治疗建议。资料复核日期为 2026 年 7 月 19 日。模型版本、开放范围、价格、服务条款、隐私政策和监管状态会变化,使用前应重新查阅官方页面;出现呼吸困难、意识异常、持续胸痛、大出血等急症信号时,不应等待 AI 回复。

先纠正旧稿:公司宣传、融资新闻和临床证据不是一回事

本页旧稿标题把百川智能称为“医疗大模型领军者”,正文还写入融资金额、投资机构、估值、医院合作、客户数量、医疗准确率和商业前景,却没有给出能够逐项核验的公告、合同、研究方案、监管记录或独立数据。旧稿还把创始人的教育经历写成医疗技术护城河,把产品路线写成确定的投资价值。这些内容既不能帮助用户选择产品,也容易把公司叙事误当成临床证据,因此本次重写全部撤回。

旧稿说法 为什么不可靠 本次处理
“医疗大模型领军者” 没有定义范围、时间、指标和独立排名 改为可核验的公司与产品地图
融资、估值与投资机构清单 缺少当期官方披露,且与用户选型任务无直接关系 不再转述无法核验的资本数字
与多家医院合作并积累海量数据 没有医院名称、合同边界、伦理审批和数据来源 删除匿名合作与数据规模叙述
医疗准确率显著高于通用模型 没有任务、样本、分母、对照和外部验证 拆成具体基准、作者论文与临床证据层级
创始人背景构成医疗护城河 个人履历不能替代产品证据、团队能力和治理 只保留官方可核验的公司身份
具备确定的投资与商业价值 属于预测,不是产品使用指南 删除投资判断,聚焦用户决策

百川智能现在有哪些与医疗相关的入口

根据百川智能官网,公司于 2023 年 3 月 24 日成立,创始人为王小川。官网当前显著展示百小医、医疗模型和“海纳百川”计划,并保留通用大模型相关入口。对用户最重要的不是背下全部型号,而是确认自己正在使用哪一种交付形态。

入口或系列 面向对象 当前可确认的定位 不要误解为
百小医 个人与家庭用户 健康信息、就医准备、报告或医嘱理解等辅助服务 持证医生、急救系统或自动处方
医疗模型 API 开发者、医疗服务机构 通过平台调用 M3 Plus、M3、M2 等服务;资格和功能以页面为准 拿到密钥即可在真实临床自动决策
Baichuan-M4 研究与产品观察者 2026 年论文描述的连续照护医疗智能体系统 已经完成所有外部临床验证的监管产品
Baichuan-M3 研究者、模型部署者 强调主动问诊、医疗推理和幻觉抑制的医疗增强模型 在所有疾病、医院和人群上都优于医生
M2、M1 等 存量用户与研究者 较早医疗模型代际,部分仍出现在平台或资料中 与 M4 功能、接口和证据完全相同
Baichuan 2 本地模型研究与旧项目 2023 年开放权重的通用模型系列 当前百小医或最新医疗 API 的同义词

产品名相近还会造成另一个误区:官网研究页出现 M4,不代表平台所有账号已经提供同名 API;价格页出现 M3 Plus,也不代表任何行业和用途都能直接申请。选型时应分别打开当前 API 文档价格页和申请条件,并记录查看日期、模型标识、上下文限制、搜索计费、速率限制和数据条款。

M4、M3、M2 和 Baichuan 2 的关系

Baichuan-M4 论文发表于 2026 年 6 月,作者把它描述为面向连续照护的医疗智能体系统:除了核心推理模型,还包含患者记忆、循证检索、工具使用、多智能体协调,以及文档 OCR、X 光和皮肤影像等多模态能力。论文报告了多个内部或公共评测结果,并在其幻觉评估中给出 3.3% 的数值;但论文也明确说明,输出供医生和机构参考,不替代持证医生的最终诊断与治疗决策。

Baichuan-M3 论文发表于 2026 年 2 月,重点是主动补问、长程临床推理与安全控制。M2、M1 是更早代际,官网和平台资料应被视为具体版本的当期说明。Baichuan 2 官方 GitHub 仓库则是 2023 年通用模型项目;开源权重可以支持本地研究,但不自带当前医疗模型的训练、检索、工具、服务保障或合规安排。

比较维度 M4 M3 M2 / M1 Baichuan 2
主要公开时间 2026 年 2026 年 更早医疗代际 2023 年
公开重点 连续照护、记忆、工具与多模态智能体 主动问诊、推理与幻觉控制 医疗问答、推理或循证增强的阶段版本 通用语言模型与开放权重
常见交付 论文和产品路线说明;实际开放以官网为准 论文、模型资料及部分平台服务 平台存量模型或资料 下载权重,自行部署
证据边界 作者团队评测不等于跨机构临床效果 基准领先不等于真实工作流安全 旧结果不能自动代表新版本 通用权重不等于医疗器械或医疗服务

“HealthBench 第一”和“3.3% 幻觉率”应该怎样读

HealthBench 官方说明显示,这项基准包含 5,000 段模拟的多轮、多语言健康对话,以医生编写的细粒度规则评价模型最后一轮回答。它比只考医学选择题更接近健康问答,但仍是基准评测:样本由合成生成和人工对抗测试构成,评分主要由模型判定是否满足规则,不是在医院中观察真实患者结局。

因此,M4 或 M3 在 HealthBench、HealthBench Hard 或团队自建 ScanBench 上取得较高分,能够支持“在这些测试定义下表现较好”,不能直接支持“诊断准确率达到某值”“所有临床任务优于医生”或“可无人监管使用”。论文中的 3.3% 也必须与作者定义的幻觉数据集、评判器、提示、模型版本和统计方法绑定,不能作为所有回答有 96.7% 临床正确率的倒数。

医疗大模型证据阶梯从公司说明、作者论文、公共基准、外部验证上升到前瞻临床研究和监管预期用途
产品说明、作者论文和公共基准分别回答不同问题。医院是否可用还需要外部验证、本地人群与工作流测试,以及与预期用途相称的监管和责任安排。图:兰塞 AI 编辑部原创。
证据 能支持什么 仍不能支持什么 下一步核验
官网产品页 公司当前公开的定位、入口和申请说明 独立效果、长期安全和临床获益 查服务条款、版本和可用性
作者预印本 方法、训练框架、团队评测和限制 同行评议结论、跨机构复现和监管许可 找代码、数据、外部复现和审稿版本
HealthBench 等公共基准 固定样本与评分规则下的相对表现 真实患病率、流程、设备和患者结果 检查版本、提示、评分器和置信区间
医院回顾性验证 历史本地数据上的错误和亚组差异 上线后人机互动和行为改变 静默运行与前瞻试点
前瞻临床研究 真实使用中的工作流、安全与结果 超出研究人群、科室和版本的泛化 持续监测、版本复验与监管核对

医疗 AI 的公开报告可参考DECIDE-AI 早期临床评价指南:除了算法性能,还应说明使用者、环境、人机互动、工作流、错误和安全事件。若准备把任何大模型接入医院,请配合本站的医院 AI 从静默验证到上线监测清单AI 医疗诊断临床验证指南使用。

个人用户:百小医适合做什么,不适合做什么

百小医的公开定位更接近健康信息与就医辅助。它可以帮助用户整理症状时间线、解释常见医学词汇、准备就诊问题、理解检查报告字段或提醒复诊事项。根据百川智能的用户协议,医疗相关输出仅供参考,不构成专业医疗服务、诊断、处方或治疗依据。这条边界比任何营销语更重要。

任务 可以怎样用 必须人工确认 不应交给 AI
就医准备 整理起病时间、症状变化、既往史和问题清单 信息是否完整,急症是否需立即处理 决定不去医院
报告理解 解释指标名称、单位和常见含义 参考范围、标本、影像原文和医生判断 只凭一个异常值自行诊断
医嘱理解 把专业表述改写为待确认的问题 药名、剂量、频次、疗程和禁忌 擅自停药、换药或加量
慢病记录 整理血压、血糖、症状和复诊时间线 设备准确性、异常阈值与治疗目标 自动调整处方
急症判断 只能提示尽快寻求帮助 由急救、医生或当地医疗系统处置 反复聊天等待确定诊断

输入健康信息前应查看当期百小医隐私政策和账号设置,确认处理主体、收集字段、第三方共享、保存、删除和账号注销方式。尽量不输入身份证号、完整病历号、联系方式、可识别人脸、他人报告或与问题无关的病史;需要医生判断时,保留原始报告和完整上下文,不要只转述 AI 的摘要。

开发者:接入医疗 API 前先做五项确认

官网“海纳百川”计划对申请主体和用途有约束,公开页面强调面向服务医疗专业人士的机构、临床决策支持或医学教育等场景,并要求真实服务使用、展示来源标识等。具体条件可能调整,应以申请页面和合同为准。免费或优惠也不等于无限调用、永久价格或免除安全责任。

检查项 必须记录 阻断条件
模型与接口 模型 ID、版本、上下文、搜索、工具、限流和错误码 只写“百川医疗模型”,无法固定版本
数据 输入字段、地区、保存、训练使用、第三方、日志和删除 真实患者数据流向不清
输出 引用、拒答、结构化字段、置信提示与禁止动作 输出可直接写入处方或诊断而无复核
评测 本地病例、严重错误、亚组、提示注入和版本回归 只用演示问题或厂商榜单验收
运行 超时、重试、降级、人工升级、审计与停用 接口失败会阻断医疗服务
成本 输入输出 token、搜索、知识库、缓存、峰值和重试成本 只看单价,不模拟真实请求链

百川平台的安全与风险说明也要求开发者针对预期用途验证可靠性、准确性和稳健性,并进行监测与人工干预。开发阶段先使用合成数据或经过授权和去标识化的数据;任何真实病历接入都应经过组织的数据、法律、安全、伦理和临床责任流程。通用的函数调用权限控制可参考AI 安全威胁建模指南,涉及基层或县域协同时可参考基层医疗 AI 落地清单

医院采购:不要购买“模型名”,要验收一个明确用途

医院不能把“使用 Baichuan-M4”作为完整项目定义。应写清谁在什么科室、对什么患者、读取哪些数据、生成什么输出、谁在多长时间内复核、错误如何升级、系统不可用时回到什么流程。世界卫生组织的医疗 AI 伦理与治理指南大模型医疗治理指南都强调预期用途、利益相关方参与、透明、责任和发布后审计。

百川医疗AI使用决策图按个人、开发者和医疗机构区分百小医、API与医院试点并列出共同检查项
选择产品前先确定身份、任务和错误后果。证据不足时应缩小用途、增加人工门禁或暂缓上线,而不是用更宽泛的宣传口径填补缺口。图:兰塞 AI 编辑部原创。
采购问题 合格证据 不能接受的替代说法
产品到底是什么 合同型号、版本、组件、部署边界和变更通知 “使用最新医疗大模型”
允许做什么 预期用途、禁用人群、禁止动作和责任人 “辅助医生全面提效”
证明了什么 对应任务的外部证据、本地数据和错误明细 只展示综合榜单或发布会数字
如何保护数据 数据流、权限、日志、第三方、跨境、保留和删除 “私有化所以绝对安全”
如何持续监测 严重错误、亚组、漂移、延迟、事件与人工修改看板 只统计调用量和医生采纳率
如何退出 数据导出、模型停用、接口替代、删除证明和原流程恢复 合同到期再讨论

国家卫生健康委等部门的“人工智能+医疗卫生”实施意见给出了可探索场景,但政策鼓励不等于某个模型已经获得特定临床用途的批准。具体产品是否涉及医疗器械、互联网诊疗、病历、个人信息或数据安全要求,应按实际功能和数据流逐项判断。

隐私与条款:上传前要看“数据之后去哪”

健康与病历数据通常比普通聊天内容风险更高。个人信息保护法将医疗健康信息列为敏感个人信息,处理需要特定目的、充分必要性和严格保护。百川智能官网与平台分别提供用户协议和隐私政策;消费者产品、开发者平台与定制项目的条款可能不同,不能用一份页面替代合同审查。

对象 上传前问题 建议
个人 是否必须输入身份、报告原图或完整病史 最小化输入,遮盖无关识别信息
开发测试 样本是否含真实患者或可重新识别字段 优先合成数据;建立授权、去标识和访问记录
生产 API 内容是否保存、用于改进、由谁处理、能否删除 写入数据处理协议和技术配置,不靠口头承诺
医院部署 模型、检索、日志、监控和支持人员分别访问什么 画完整数据流,做最小权限和供应商审计
终止服务 数据、向量库、日志、备份和派生内容如何处理 合同中写明导出、删除时限与证明

如果系统会长期保存患者记忆,除了确认功能有用,还要明确记忆的来源、纠错、过期、合并、删除与访问权限。模型“记得更多”不一定更安全:错误病史、错配患者或过期用药同样可能被持续放大。

三个常见选择场景

只想理解自己的报告或准备就医

优先使用面向个人的产品入口,把任务限制为信息整理和问题准备;保留报告原文,不让 AI 决定诊断或用药。任何与医生意见冲突的内容,回到医生或药师确认。本站的AI 幻觉核验方法可用于拆分回答中的事实与推断。

要给健康应用增加问答功能

先确认 API 资格和用途,再做带严重度分级的本地评测。评测至少包含信息不足、急症、孕产妇、儿童、老年、多病共存、药物冲突、提示注入、无依据引用和接口失败。上线前建立人工升级和停用开关,不要把模型自由文本直接写入诊疗记录。

医院准备采购或试点

先选一个边界清楚且能人工复核的任务,例如病历缺项提示或出院随访问题整理;完成历史数据验证、静默运行和有限真实试点,再决定扩大范围。不要把发布会分数写成验收指标,也不要承诺固定的“效率提升百分比”。采购、试点和监测步骤详见医院 AI 落地完整清单

怎样自己复核一条百川模型宣传

看到“第一”“超过某模型”“幻觉率最低”或“临床级”时,不必立刻接受或否定,可以把句子拆成可验证字段。先找最初出处,再找论文中的表格、脚注和限制;如果只有媒体转载,要继续追到公司页面、论文或数据仓库。日期同样重要:模型、对手、提示和评判器只要有一个变化,旧排名就可能失效。

字段 需要回答的问题 缺失后的正确写法
对象 具体是 M4、M3、M3 Plus,还是带检索和工具的完整系统? 不能笼统写“百川模型”
任务 健康问答、主动问诊、报告 OCR、影像理解还是诊断决策? 只能说“在该测试任务中”
数据 公共还是团队自建,是否可能进入训练,包含哪些语言和人群? 不能外推到所有疾病和患者
对照 比较模型的精确版本、日期、提示、工具和推理预算是否一致? 不能只写“超过 GPT”
评分 人工医生、模型评分器还是规则;有没有一致性和置信区间? 应标注评分方法和不确定性
复现 是否公开代码、样本、提示、日志或独立复测? 标注为作者团队报告
用途 测试结论与实际产品的预期用途、输入和人工门禁是否一致? 不得直接写成临床可用证明

例如,“M4 幻觉率 3.3%”至少要展开为:Baichuan-M4 作者团队在论文所述评测设置、数据和判定规则下报告 3.3%;该数值不等于诊断错误率,也没有自动覆盖百小医每次对话、所有 API 配置或医院真实病例。这样写会少一点戏剧性,却能让读者知道结论从哪里来、适用于哪里、还缺什么。

本地评测不要只复制公共榜单

公共基准适合做起点,本地评测则要围绕真实任务的失败后果设计。开发者和医院应先冻结模型、系统提示、检索源、工具权限和输出结构,然后用历史样本与合成边界样本测试;测试集要包含正常案例,也要包含信息缺失、相互矛盾、罕见情况、急症、否定表达、单位错误、患者错配和恶意指令。每个严重错误都需要保存输入、输出、引用、模型版本、人工结论和处置,而不是只汇总一个平均分。

测试层 示例 至少记录
事实忠实 能否忠实读取报告、病史和指南,不补造缺失值 原文位置、错误类型、严重度
信息获取 关键信息不足时是否补问或拒答 缺失字段、补问质量、过早结论
安全升级 急症、禁忌和高风险人群能否转人工 升级时机、遗漏、误报和延迟
证据检索 引用是否真实、当前并支持对应主张 来源、版本、段落和检索失败
工具权限 是否会越权查询、写入、发送或执行 调用参数、批准人、结果和回滚
亚组 不同年龄、语言、疾病和机构是否出现差异 分层样本、置信区间和不可用范围
版本回归 模型或知识库更新后旧能力是否退化 前后版本、变化项和放行决定

如果样本量不足以证明某项高风险用途安全,正确结论不是降低门槛,而是把输出限制为信息整理、增加人工复核、缩小适用人群或暂不部署。真实运行后还要把人工修改、患者路径和安全事件加入监测,因为模型离线得分无法覆盖界面、提醒疲劳、人员培训和流程拥堵。

常见问题

Baichuan-M4 已经开放 API 了吗?

不能只凭 M4 论文或官网宣传推断所有开发者都能调用同名 API。本文复核时,平台价格与文档公开列出了若干 M3、M2 系列服务;M4 的具体开放对象、模型 ID、功能和价格应以账号控制台、最新文档或合同为准。

百小医可以替代医生吗?

不可以。官方用户协议把医疗输出限定为参考,不构成诊断、处方或治疗依据。它更适合帮助整理信息、理解术语和准备就医问题,急症、诊断和用药变更应由医疗专业人员处理。

HealthBench 分数高,能说明医疗水平更好吗?

它说明模型在 HealthBench 的样本与评分规则下表现较好。它不能单独证明在某医院、某疾病、某患者亚组或真实工作流中更安全有效,也不能替代监管核对、本地验证和持续监测。

3.3% 幻觉率是不是等于 96.7% 诊断准确率?

不是。幻觉率取决于测试集、定义、判定器、提示和模型版本,与诊断准确率、敏感度、特异度或患者结局不是同一个指标。引用该数字时必须保留论文方法和作者自评边界。

Baichuan 2 开源模型能否本地搭成医疗系统?

可以用于研究或原型,但开放权重不自动带来医疗训练数据、循证检索、患者记忆治理、临床验证、监管资格或运维保障。若用于真实医疗,应从预期用途、数据、评测、人机流程和责任重新建立完整证据链。

免费医疗 API 是否值得优先采用?

价格只是一个维度。还要比较用途限制、版本稳定性、搜索与知识库费用、数据条款、错误类型、人工负担、监测、迁移和退出成本。免费不能抵消患者安全、隐私和供应商锁定风险。

一页核对清单

门禁 通过标准
产品身份 入口、模型 ID、版本、交付方式与更新日期明确
用途 用户、人群、输入、输出、人工动作与禁用范围明确
证据 公司声明、作者论文、公共基准、外部验证和本地验证分层记录
数据 收集、传输、保存、训练、第三方、导出与删除可解释
安全 急症升级、拒答、权限、审计、错误处理和原流程降级可用
版本 更新通知、回归集、灰度、回滚和旧版本处置写入流程
运行 严重错误、亚组、延迟、成本、人工修改和安全事件持续监测
退出 能停用、迁移、导出、删除并恢复替代流程

延伸阅读:医院项目请看医院 AI 场景选择与上线门禁;基层机构请看县域医共体与基层医疗 AI 清单;诊断类产品请看临床验证与错误分层;通用风险请看AI 威胁模型与权限控制;本站来源、更新与纠错原则见关于兰塞 AI 与编辑规范

编辑复核与纠错记录:本文由兰塞 AI 编辑流程于 2026 年 7 月 19 日重写。旧稿中无法核验的融资、估值、投资机构、医院合作、客户规模、准确率、创始人护城河和投资价值叙述已撤回;新版依据百川智能官网、平台文档、用户与安全条款、M4/M3 作者论文、HealthBench 官方资料、WHO 治理指南和临床实施报告规范,改为产品地图、证据阶梯、个人使用、API 接入与医院采购核对指南。后续若产品开放范围、条款或论文版本变化,本站将按可核验来源更新并保留纠错说明。