返回资讯中心
外部精选
软件工程
#工程实践#架构

70强项目观察之无界应用:AI应用正在从“有功能”走向“能完成任务”

从无界应用赛道 15 个决赛项目来看,AI 应用正在从“功能可用”进一步走向“任务完成”。

InfoQ 中国世界人工智能开源大赛6 分钟阅读中文

以下正文同步自 InfoQ 中国,版权归原站所有,已转换为易读排版。

从无界应用赛道 15 个决赛项目来看,AI 应用正在从“功能可用”进一步走向“任务完成”。

总结文本、生成报告、规划路线、分析数据、回答专业问题,大模型已经进入越来越多可被数字化的场景。但真正进入行业之后,一个问题愈发清晰:一个 AI 功能能够运行,与一个真实业务问题得到解决,是两回事。

行业任务往往同时包含非结构化信息、确定性规则、历史状态、外部工具和人工责任。模型不仅要“理解”,还要把结果交给后续系统;不仅要“调用”,还要确认动作是否真正生效。

这 15 个项目呈现出一个共同趋势:模型不再承担全部能力,而是逐步嵌入真实业务流程,与规则、工具、数据和人工决策共同构成完整交付链。由此,可以看到四条相对清晰的技术演进主线。

质链 Agent 面向商业航天任务,解决的并不是简单的文档检索,而是判断历史验证证据能否继续用于新的任务状态。项目以设计图号关联对象,通过六维确定性核验,将结果分成直接继承、条件继承、差异验证、重新验证和不可判定,大模型只辅助寻找材料缺口,并不直接生成最终核验结论。

“有界”则面对制造供应链异常。大模型负责理解邮件、群聊中的非结构化信息,物料清单、库存、产能、方案求解和权限门禁交给确定性代码;OR-Tools CP-SAT 生成候选恢复方案后,还要经过独立验证和人工审批,并回读 ERP 测试实例中的实际状态。

RoadMan 也不是单纯生成旅行攻略。多 Agent 理解偏好之后,确定性程序继续检查路线、时间窗口、连续驾驶、电量余量、餐饮住宿和返程条件,发现方案不成立时重新规划。

DriveMate 进一步把需求理解、安全裁决、工具执行和状态回读放进同一流程,区分“已经发起动作”和“结果已经确认”;CarLife AI Agent 则通过五个业务智能体,将购车、用车、出行、陪伴和售后需求拆成相互隔离的协作任务,并统一经过确认关口。

越来越多团队开始重新界定大模型在系统中的角色,不再把它当作包办所有任务的“万能大脑”。

商业航天项目中,关键技术状态由确定性规则核验;供应链项目中,库存、产能和方案求解由代码和优化器承担;RoadMan 中,时间、电量等硬约束也不交给模型自由判断。

穹野智保同样将农业保险中的遥感分析、合同规则、空间核验、赔付测算和报告生成串联为完整工作流。大模型可以参与信息理解和报告组织,但理赔过程仍受到法规语料、保险合同和版本化理赔规则约束,最终归档也由具名管理员完成。

HunterCode 则把投研方法拆成可复用的 Skill,并连接多模型与外部数据源,让模型、研究方法、数据获取和历史分析逻辑在同一工作流中协同,而不是依靠一次自由对话完成研究。

大模型擅长理解邮件、合同、需求和上下文,也能够在开放空间中形成候选方案;但金额、库存、产能、权限和合规边界,需要能够复算和验证的机制。

因此,行业 AI 并不是让大模型吞掉所有传统软件,而更可能形成混合系统:模型负责理解与协同,确定性模块负责计算和裁决。

生成式 AI 最自然的行为是继续生成,但真实行业系统往往需要另外一种能力:在证据不足时停止。

保险归因罗盘把这一点做得非常明确。系统不仅分析经营指标变化,还为每条结论记录后验概率、置信区间及允许使用的表述;缺少随机化证据时,只能输出“相关”,不能将统计关联直接表述为因果关系。

VisionDoctor 同样强调真实证据。模型声称自己“看过”的材料,如果工具没有实际交付,就不能进入诊断依据。修复结果还必须先在隔离环境中验证,再进入人工审批。

VisionData Gate 则把状态缺失、摘要漂移、工具失败和并发版本过期明确返回为阻断,并区分是否允许重试;数据正式发布仍保留人工签字责任。

PASS、WAIT、BLOCK,不可判定、等待审批、重新验证——这些状态的出现,意味着应用开始承认真实世界的不确定性。

在高责任行业中,可靠性不只意味着正确回答更多问题,也意味着在无法确认时不强行回答。

Inno Agent 不再把每轮学习对话视为孤立问答,而是通过学习者画像、知识库和跨对话检索保留上下文,并结合定时任务持续推进学习;Traittutor 同样根据学习目标和学习者状态动态调整路径。Village of Shadows 则把多智能体学习设计成可参与、可观察、可复盘的连续过程。

这种“连续上下文”也出现在科研和团队协作中。Agentero 将论文、批注、笔记和 AI 讨论连接成持续积累的研究工作空间;day0 则让 Agent 先明确角色、协作关系和工作章程,经人工确认后再持续发现和执行任务。

这些项目共同指向一个变化:AI 正在从“用完即走”的工具,转向具备持续状态、长期任务和角色边界的工作系统。

因此,未来 Agent 产品的重要资产可能不只是聊天记录,还包括用户画像、任务状态、权限范围、知识库、Skill 和持续运行上下文。随之而来的问题也更具体:记忆是否准确、状态是否过期、权限能否同步、能力不足时能否识别并反馈。

从 15 个项目看,无界应用所体现出的核心趋势,并不是 AI 进入了多少行业,而是行业 AI 的评价标准正在改变。

过去,人们更容易看模型准确率、对话体验和功能数量。现在,真实应用需要回答另一组问题:数据是不是真实的?约束有没有满足?工具是不是实际执行了?结果有没有回读?不确定时能不能停止?人应该在哪个节点介入?

这意味着 AI 应用正在从“生成内容”走向“完成任务”,从模型能力竞争走向系统交付能力竞争。

未来行业 AI 的价值,也越来越需要通过任务成功率、约束满足、异常恢复、人工接管以及最终业务结果来衡量,而不能只依赖一次漂亮的 Demo。

这正是 GOAI 所希望验证的方向:让 AI 进入商业航天、工业制造、保险、汽车、教育、科研等真实场景,在规则、流程、工具和人的共同约束下完成真实任务。

AI 应用的价值,最终不在于功能列表有多长,而在于它能否真正推动一个问题从输入走向结果。

9 月 22 日至 23 日,世界人工智能开源大赛(GOAI)总决赛及 GOAI DAY 将在杭州举行。当 AI 开始深入真实业务流程,决赛要检验的,也将不只是“有没有 AI”,而是 AI 究竟能不能真正被用起来。

正文由 FLUX 从来源站点 RSS 同步,内容未经改写;遇到排版缺失或需要图片、视频时请以原文为准。