opencode

opencode 上线免费模型 Fledge Alpha Free:上线背景 + 能力实测(2026-10)

opencode logo

10 月 1 日,opencode 上架了一个免费模型:Fledge Alpha Free——$0、宣称 1M 上下文、支持图像和工具调用。社区第一反应是「DeepSeek 换皮?」本文基于 2026-10-04 的完整实测(58 次真实调用 + 2 轮对照 + 1 个真实修复任务),记录我看到的全部证据。结论放在前面:免费是真的,能力够日常用,「多模型路由」基本实锤,但具体是谁还没有证据。

一、成本与速度:白嫖确认

Fledge Alpha Free 在 models.dev 模型列表中的信息(红框标注,$0.00 / 1M 上下文)

二、能力剖面:基础项全过

维度 测法 结果
推理(3 题) 水箱速率 / 逻辑三段论 / 一元二次方程 3/3 全对,步骤完整
事实性(5 题) Python 之父 / HTTP 404 / C# 首发 / Git 创始人 / JSON 全称 5/5 全对,幻觉率 0%
结构化输出(3 任务) 简单对象 / 嵌套对象 / 含数组 3/3 直接 JSON 解析合规
稳定性(同 prompt ×10) 同一句话重复 10 次 10/10 成功,隐藏发现见下文第三节
特殊 token 回显 6 种模板 token 要求逐字回显 4 个干净回显;`<

三、路由发现:「不是单一模型」实锤

用同一句话(让模型重复输出一行文字)重复测试十几次,input token 计数出现三个稳定档位:

25995 / 32396 / 33818(跨次随机分布)

同一平台、同一系统提示下,input 计数跨次跳变 → 请求被路由到了不同的后端执行。这与社区「Fledge = 多模型路由网关(疑 DeepSeek V4.1 + Kimi k3 + 未知)」的情报方向一致。

对照测试(两轮):我特意用 DeepSeek 和 Kimi 做了两轮指纹对照(mynvidia 与 mysensenova 两个渠道)。但发现跨平台 token 统计口径不一致——opencode(zen) 返回完整 input 计数,nvidia/火山等渠道返回「未命中缓存增量」(如 deepseek 的 input=74 + cache.read=27648)。绝对值不在同一基准,指纹直接比对不可行,未能指认具体是哪家的模型。这本身是这次评测的方法论发现:词表指纹法仅限同平台内使用。

能确认的:Fledge 不是单一模型,「多后端路由」证据充分;不能确认的:具体后端是谁(对照因口径不可比而悬置)。

四、干活能力:能修 bug,文档会「套模板」

修 bug(真实任务):让它修复一个 MAUI 俄罗斯方块游戏的旋转墙踢缺陷(原实现缺纵向墙踢,方块贴底时旋转失败)。交付的标准 SRS 墙踢表 16/16 条对照规范全部正确,逻辑验证通过(贴底场景:旧墙踢失败 → 新墙踢成功)。单轮成型,无中间错误。

写文档(暴露短板):让它写项目 README 初稿,构建步骤、玩法操作表全部正确;但项目结构目录套了通用模板——给的 Models/Services/Views 是 Web/MVVM 经典结构,实际项目是 MAUI Android(平铺的 App/GameLogic/GameView)。没拿到真实结构信息时,它按「看起来合理」的模板输出,未核对项目本身。

五、测试方法与判定标准

测试围绕几个维度展开,各维度的判定标准如下,读者可自行验证:

维度 怎么测 判定标准
推理 3 道文字题(含计算/逻辑/方程) 答案正确且步骤完整自洽即过关
事实准确性 5 道常识题(人物/状态码/年份等) 答案与公认事实一致即过关,答错或答不出计为异常
结构化输出 3 个任务要求只输出 JSON 输出能直接按 JSON 解析且字段完整即过关,多余文字/尾逗号算违规
稳定性 同一句话重复 10 次 每次都能正常作答即过关;结果是否一致作为附加观察点
特殊 token 6 个模板控制标记要求逐字回显 能原样回显即过关;吞掉或拒绝回显计入异常
速度/费用 记录每次耗时与 token 统计 价格按平台返回为准;速度按输出 token ÷ 耗时折算

过程里踩了两个坑,也如实交代:一是不同平台的 token 统计口径不一样,导致指纹比对没法做(见上文第三节);二是中文环境下的编码问题(测试时已规避)。这两个坑也划定了本文的结论边界——凡是证据够不着的判断,比如后端具体是哪几家,都只写到「存疑」,没有硬下断言。

六、怎么用它

全部数据为 2026-10-04 本人实测采集,测试方法与判定标准见上文第五节,可自行复测对照。