个人简历
个人信息
出生年月:1991-10
学历:本科
工作年限:13 年
居住地:上海
求职方向:AI 应用 / Agent 工程、Go / Java /平台架构
GitHub:https://github.com/bigfish1913
核心能力
- AI Agent 工程:负责 Agent 产品从定义到落地,具备 Agent 架构、工具编排、RAG、知识库、评测观测、沙箱隔离和长任务可靠性建设经验。
- 后端与平台:Go、Java,熟悉 gRPC、Kafka、MQTT、Redis、MySQL等中间件;具备 Vue、React、Flutter 全栈协作经验。
- 分布式系统:在 WiFi IM 项目中支撑百万级长连接、日均亿级消息,在携程票务项目中支撑峰值 400 万/min 系统流量,具备高并发高可用实际落地经验。
- 业务与管理:覆盖社交 IM、基础架构、电商票务、支付、自动驾驶数据等领域;有 5 年带人经验及 3~5 人项目 Owner 经验。
- AI提效:熟练使用 Claude Code、Codex、Pi 等VibeCoding工具,参与 OpenMatrix、MatrixCode、RPI 等开源项目。
工作经历
2026/01 ~ 至今|某 AI 创业公司|技术负责人
负责 AI 应用、AI 游戏及业务 Agent 产品线的架构设计、核心研发和上线交付,协同前后端、数据与运营团队完成产品验证。
2024/01 ~ 2026/01|WiFi 万能钥匙|资深 Golang 开发
负责基础架构、服务治理和高并发业务系统建设,覆盖网关、服务发现、分布式 IM、热更新及实验平台。
2022/03 ~ 2023/12|蔚来汽车(自动驾驶数据运营)|技术专家
负责安全中台、车端数据存证、事故监控通知及事故分析报告等系统的架构和核心研发。
2017/03 ~ 2022/02|携程旅行网|开发经理
负责抢票订单、任务调度、支付及交易支撑系统,参与高并发架构、性能优化和团队协作。
2013/07 ~ 2017/03|其他|一线开发
参与企业管理、酒店业务、物联网及支付相关系统的开发与维护。
重点项目
某 AI 创业公司|技术负责人|2026/01 ~ 至今
AI Web 应用生成平台
项目描述
产品目标是“释放创造力、降低创作门槛”,用户通过自然语言描述需求,生成可运行的 Web 应用。系统拆分为交互前端、需求分析 Agent、业务后端和 Code Agent:需求分析 Agent 负责澄清和结构化用户意图,Code Agent 根据结构化需求完成前后端代码生成、运行和交付。
我的职责
- 参与项目初期产品定位、技术演进路线、业务闭环及商业化路径设计。
- 从 0 到 1 负责 AI 应用产品线的总体架构和核心 Agent 研发,协同前后端完成 MVP 验证与上线支撑。
- 协调前端、后端、数据和运营团队,推动产品指标定义、数据分析及运营策略落地。
技术方案与核心工作
- Agent 开发框架:搭建统一 Agent 开发框架,建立研发规范,抽象前端页面、服务端代码和 API 接口生成能力,以及通用的工具调用、任务编排和状态管理能力,沉淀可复用核心工具。
- 服务端生成能力:基于Supabase基建,扩展 Code Agent 的服务端代码生成能力,生成服务端业务逻辑和 API 接口,支持数据云端存储,扩展生成应用的能力。
- 执行环境隔离:设计动态沙箱隔离机制,为codeagent 代码生成提供独立运行环境;完善环境变量和 Token 加密管理,支持任务隔离和动态扩缩容。
- 配置分发:建设 Skills、Tools 和模型配置的热更新与分发能力,支持线上 A/B 验证、快速测试和版本回滚。
- 评测与观测:落地 Agent 评测和可观测体系,追踪任务链路、生成耗时、工具调用次数、Token 消耗等关键指标,支撑问题定位和版本对比。
- Harness 工程:通过提示词优化、工具编排、运行时测试和静态检查,持续验证 Agent 生成链路的输入、调用和输出质量。
- 长任务可靠性:落地任务重试、Checkpoint 断点续跑、无效/越权工具调用拦截等机制,覆盖执行失败、任务中断和异常调用等场景。
项目成果
- 支撑 AI Web 应用产品完成 MVP 验证和上线交付。
- 打通前端页面、服务端代码、API 接口和运行环境的端到端生成交付链路。
- 形成覆盖 Agent 开发、工具复用、配置发布、质量评测、链路观测和异常恢复的工程闭环。
- 将 Skills、Tools、模型及评测能力沉淀为平台化组件,支持后续多个 Agent 产品复用。
AI 游戏生成平台
项目描述
基于 AI 应用生成能力拓展游戏垂直场景,帮助用户快速搭建可玩的游戏。项目覆盖从一句话创意输入,到游戏设计文档(GDD)生成、美术与音频素材生产、系统拆分、代码开发和测试交付的完整生产链路。
我的职责
- 负责项目整体规划、技术方案和核心 Agent 的研发与上线,推动游戏生成能力从方案验证走向业务落地。
- 搭建 PGC(专业内容生产)内容链路,配合运营团队制定核心数据指标和分析模型。
- 负责精灵图生成、动画对齐、美术一致性和音频生成等资产生产难题的方案攻关。
- 建设游戏核心素材库,推动素材生成、检索和复用能力落地。
技术方案与核心工作
- 20 阶段生产流水线:将游戏生成拆分为创意理解、GDD 生成、美术与音频素材、系统拆分、代码生成、运行测试等阶段,建立阶段输入、输出和交付规范。
- Gate Check 质量门禁:在各阶段设置产物校验和门禁规则,识别中间产物缺失、格式不一致和跨阶段上下文偏移,阻止不合格产物继续向下游传递。
- 游戏资产工程:优化精灵图生成提示词、视频抽帧和动画对齐方案,处理精灵图帧数、尺寸、位置和动作一致性等问题。
- 素材库检索:建设游戏素材库,采用关键词多路召回和 RAG 匹配策略,支持按角色、动作、风格等维度检索和复用素材。
- 多 Agent 协同:拆分设计、开发和测试 Agent,隔离各阶段模型调用、上下文和质量标准,支持不同阶段独立调试和迭代。
- 多模型组合:基于多模型组合,采用不同阶段使用不同模型,降低token成本
- 多人联机支持:扩展游戏生成链路的联机能力,支持生成具备多人联机玩法的游戏,并完成相关联机逻辑接入与运行验证。
项目成果
- 落地从一句话输入到可玩游戏交付的 20 阶段生成流水线。
- 建立阶段化质量门禁,形成对游戏设计、素材、代码和测试产物的过程控制。
- 打通游戏素材生成、抽帧处理、检索复用和开发交付链路,沉淀可复用的游戏素材库。
- 实现设计、开发、测试 Agent 的职责拆分,为后续独立迭代和成本治理提供基础。
- 支持多人联机游戏的生成与交付,扩展 AI 游戏生成平台的玩法覆盖范围。
智能客服 Agent
项目描述
基于 AI Agent 搭建智能客服系统,为平台用户提供常见问题解答、操作指引、提示词建议和系统使用指南,帮助用户快速解决使用过程中的常见问题。
我的职责
- 负责项目整体设计、技术选型和核心 Agent 研发,推动客服场景从方案验证到系统落地。
- 建立基于文档式知识库(LLM Wiki)的知识管理方法,设计原始知识构建、处理、更新和查询使用流程。
- 负责用户意图识别、风险内容识别与拦截、内容安全校验及敏感数据脱敏等能力建设。
技术方案与核心工作
- 知识源建设:以业务文档和产品资料作为统一知识源,建立文档采集、内容清洗、格式解析和数据标准化流程。
- 知识抽取与检索:定时抽取和更新结构化知识,建立查询、召回和回答生成流程,支持客服 Agent 按场景检索相关内容。
- 知识热更新:建设语料定时更新和文档热更新链路,支持知识增量更新,避免每次知识变化都依赖完整发布流程。
- 安全治理:识别用户意图和风险行为,对风险内容进行拦截,并对输出内容执行安全校验和敏感数据脱敏。
项目成果
- 形成从文档采集、清洗、标准化、抽取、检索到热更新的知识库闭环。
- 将知识维护从分散配置统一到文档式知识源,支持业务语料持续更新和客服 Agent 复用。
- 完成意图识别、风险拦截、内容安全校验和敏感数据脱敏能力落地。
运营分析 Agent
项目描述
面向产品运营团队建设自动化运营分析助手,将分散在多个业务系统中的数据汇总为可读结论,自动生成日报、周报和指标变化分析,辅助运营人员完成日常复盘和策略决策。
我的职责
- 负责运营分析 Agent 的方案设计和核心研发,梳理数据读取、指标计算、结论生成和报告交付流程。
- 接入业务系统数据,围绕新增用户、日活、留存等核心指标建立统一的分析输入和口径。
- 设计日报、周报及异常波动分析模板,将指标结果转化为面向运营人员的可读结论和行动建议。
技术方案与核心工作
- 数据接入:封装业务数据读取能力,统一不同系统的数据格式、时间范围和查询参数,支持按日报、周报等周期拉取数据。
- 指标计算:围绕新增、日活、留存等指标建立聚合和对比逻辑,支持环比、趋势和异常波动分析,减少人工整理口径不一致的问题。
- Agent 分析:将结构化指标、历史趋势和业务上下文注入 Agent,由 Agent 生成指标解读、问题定位和运营建议。
- 报告编排:按固定模板编排日报和周报内容,区分数据摘要、核心变化、异常项和建议项,保证输出内容结构稳定、便于复盘。
- 任务调度与追踪:建设周期性报告生成流程,记录数据读取、指标计算和结论生成状态,支持失败重试和结果追溯。
项目成果
- 建成从业务数据读取、指标聚合、趋势分析到日报/周报生成的自动化链路。
- 将新增、日活、留存等核心指标统一纳入分析流程,降低运营人员手工取数和整理成本。
- 输出包含数据摘要、异常变化和运营建议的结构化报告,为运营复盘和策略调整提供依据。
WiFi 万能钥匙|资深 Golang 开发|2024/01 ~ 2026/01
负责基础架构与服务治理(网关、服务发现、中间件)及高并发业务系统的 0→1 建设。
技术栈:Go、gRPC、Kafka、MQTT、Redis、MySQL、xDS
分布式 IM 系统
项目描述
建设覆盖单聊、群聊和聊天室的分布式 IM 系统,面向百万级长连接和高并发消息投递场景。不同会话规模下消息扩散成本差异明显,需要在消息时效、写放大和读取压力之间进行平衡。
我的职责
- 主导分布式 IM 系统的架构设计和核心链路研发,拆分连接管理、消息投递、会话路由等核心模块。
- 负责基于 MQTT 的分布式推送链路和长连接管理,处理连接建立、在线感知和消息可靠投递等场景。
- 负责高并发消息处理方案设计,通过消息队列削峰和分区处理支撑亿级消息流量。
- 负责分布式严格递增序列号服务的方案设计和实现,为消息、会话等业务提供全局有序 ID,规避数据库单点依赖。
技术方案与核心工作
- 消息扩散模型:按会话规模组合读扩散与写扩散,控制大规模会话下的写放大和读取成本,兼顾消息送达时效。
- 长连接管理:基于 MQTT 建设分布式推送链路,负责客户端长连接管理、在线状态感知和消息下发。
- 消息处理:通过 Kafka 等消息队列进行流量削峰和异步解耦,结合分区处理支撑高并发消息消费。
- 可靠性治理:围绕消息投递、连接状态和消费链路设计重试、分区及故障恢复方案,保障核心消息链路连续运行。
- 序列号服务:采用“内存计数 + 文件持久化”的混合方案,实现全局严格递增 ID 生成,降低对数据库单点的依赖。
项目成果
- 支撑百万级长连接、日均亿级 MQTT 消息。
- 万级并发下端到端消息延迟 ≤ 500 ms,可用性 ≥ 99.99%。
- 完成单聊、群聊和聊天室多种会话模型的统一架构落地。
- 交付分布式严格递增序列号服务,满足 IM 业务对全局有序 ID 和持久化的需求。
服务网关与基础组件
项目描述
客户端、App、小程序和内部服务需要统一的协议转换、接入和服务寻址层,后端服务规模达到数百个。项目同时建设服务发现、负载均衡和分布式基础组件,支撑微服务体系稳定运行。
我的职责
- 负责网关、服务发现和基础组件的架构设计、技术选型及核心研发。
- 落地基于 Envoy 的 UDS 网关,实现 HTTP 到 gRPC 的协议转换。
- 自研小程序和通用 Gateway,并完成 Kubernetes 服务发现、etcd 注册存储和 xDS 负载均衡链路落地。
技术方案与核心工作
- 统一接入:基于 Envoy 和 UDS 建设协议转换网关,将外部 HTTP 请求转换为内部 gRPC 请求,统一多端接入方式。
- 服务发现:通过 Kubernetes API Watch 机制感知服务实例变化,以 etcd 存储服务注册信息,并通过 xDS 下发服务发现和负载均衡配置。
- Gateway 抽象:针对 App、小程序和内部服务抽象通用 Gateway,统一路由、寻址和协议适配能力。
- 配置同步:围绕服务实例变更、路由更新和负载均衡策略下发设计配置同步链路,减少服务扩缩容过程中的人工干预。
- 稳定性治理:结合连接复用、超时控制、异常返回和实例摘除处理网关异常,保障协议转换和服务寻址链路稳定运行。
项目成果
- 网关协议转换峰值 QPS 达 3 万+,完成多端统一接入能力建设。
- 完成基于 Kubernetes、etcd 和 xDS 的服务发现与负载均衡落地,覆盖数百个微服务。
- 形成网关、服务发现和负载均衡的一体化基础组件,支持服务实例动态变化和业务水平扩容。
热更新平台
项目描述
App 和 RN 业务需要在不发版的情况下更新客户端资源,平台需要与 CI/CD 流程打通,并支持按版本、策略和流量范围进行可控下发。
我的职责
- 从 0 到 1 负责热更新平台的整体设计、技术选型和核心研发。
- 打通资源构建、版本管理、发布策略和客户端拉取链路,完成与 CI/CD 流程的整合。
- 设计策略拉取、限流和版本管理能力,支撑 RN 与 App 客户端热更新。
技术方案与核心工作
- CI/CD 集成:将客户端资源构建、版本生成和发布流程接入 CI/CD,统一管理资源版本和发布状态。
- 策略下发:根据客户端版本、业务策略和发布范围控制资源拉取,支持按策略进行灰度下发。
- 发布控制:通过限流和版本管理控制更新节奏,降低集中更新对客户端和服务端链路的压力。
- 客户端适配:兼容 RN 与 App 两类客户端资源更新流程,处理版本校验、资源拉取和更新生效等环节。
- 版本治理:维护资源版本、兼容范围和发布状态,支持版本回退、失败重试和异常版本拦截,降低热更新对线上版本稳定性的影响。
- 发布观测:围绕资源拉取成功率、更新失败、版本分布和发布进度建立状态记录,支持问题定位和策略调整。
项目成果
- 完成 RN / App 热更新平台从 0 到 1 建设,实现客户端资源可控下发。
- 打通从资源构建、CI/CD 发布到客户端拉取和版本管理的完整链路。
- 形成策略拉取、限流、版本校验、失败重试和回退能力,支持热更新过程的风险控制。
太极 A/B 实验平台
项目描述
面向多个业务团队提供灰度发布、功能实验和策略验证能力,平台需要统一实验分流接入方式,并为实验效果评估提供统计依据。
我的职责
- 维护太极实验平台的 Java / Go 双语言 SDK,负责实验分流、策略读取等核心能力。
- 支撑多个业务服务接入灰度发布和 A/B 实验,处理实验配置、分流规则和结果回收。
- 将卡方检验、P 值等显著性检验方法落地到实验效果评估流程。
技术方案与核心工作
- SDK 接入:维护 Java / Go 双语言 SDK,为业务服务提供统一的实验配置读取和分流接口。
- 实验分流:基于用户或业务策略执行实验分组,支持灰度发布、功能实验和策略验证。
- 效果评估:将卡方检验、P 值等统计方法引入实验结果分析,辅助判断实验结果是否具有统计意义。
- 平台治理:统一实验配置、分流规则和效果评估流程,降低业务服务重复接入成本。
- 分流一致性:统一实验参数、分组规则和结果上报口径,保证同一用户在实验周期内分组稳定,减少实验样本污染。
- 实验监控:关注分组流量、核心指标变化和异常样本,支持实验过程中的灰度调整、暂停和结果复盘。
项目成果
- 支撑数百个服务接入实验分流、灰度发布和策略验证。
- 完成 Java / Go 双语言 SDK 维护和实验能力统一接入。
- 形成从实验配置、流量分组到效果评估的平台化能力。
- 将统计显著性检验和实验过程监控纳入平台流程,提升实验结论的可解释性和复用效率。
蔚来汽车|自动驾驶数据运营|技术专家|2022/03 ~ 2023/12
事故监控与通知平台
项目描述
事故平台包含事故监控和事故处理两部分:监控车辆 CAN 组件中的气囊点爆、碰撞等信号,在事故发生时及时感知并触发通知;事故处理模块负责事故记录、跟进和后续处理。
我的职责
- 从 0 到 1 设计事故监控策略,梳理监控目标、信号范围和事故判定规则。
- 搭建事故通知链路,支持飞书消息、群组消息和加急通知等不同通知方式。
- 负责核心消费链路和异常处理方案,沉淀飞书调用 SDK,降低其他业务接入通知能力的成本。
技术方案与核心工作
- 高并发消费:采用多线程消费队列处理高并发消息,针对约 3 万+ QPS 消息消费场景设计消费链路。
- 消费协调:通过分布式锁协调并发处理、抑制重复消费,结合业务处理状态控制重复告警和重复回收。
- 异常补偿:增加补偿日志和重试处理,对消费失败、通知失败等异常场景进行补偿。
- 业务降级:针对核心数据查询和通知链路设计多级业务降级策略,保证异常情况下核心数据仍可获取。
项目成果
- 完成事故监控、事故通知和事故处理链路从 0 到 1 落地。
- 支持约 3 万+ QPS 消息消费场景,完成多线程消费和异常补偿能力建设。
- 沉淀通用飞书通知 SDK,支持飞书、群组和加急等通知方式复用。
可视化事故分析平台
项目描述
基于 Foxglove 搭建事故数据可视化与分析平台,接入 ROS 2 bag、MCAP 等记录文件,解析 Radar、Lidar 等多传感器数据,支持事故场景回放、时序对齐和关键目标信息展示,并结合机器学习模型辅助判断是否为真实事故。
我的职责
- 负责平台整体方案设计和核心功能研发,打通事故数据接入、解析、可视化和分析流程。
- 梳理 Radar、Lidar 等传感器数据格式及时间戳关系,完成多源数据解析、标准化和时序对齐。
- 结合机器学习模型设计事故候选筛选和结果校验流程,辅助区分真实事故与误报场景。
技术方案与核心工作
- 数据解析:接入和解析 ROS 2 bag、MCAP 等记录文件中的 Radar、Lidar 等传感器数据,统一坐标系、时间戳及目标信息,为可视化和算法分析提供标准输入。
- 场景回放:基于 Foxglove 组织多传感器时序数据,支持事故前后关键时间窗口回放、目标轨迹查看和多视角联动分析。
- 事故判定:将传感器特征、车辆状态和事故上下文输入机器学习模型,结合规则校验输出真实事故判断结果及辅助分析依据。
- 数据闭环:沉淀事故样本、模型判断和人工复核结果,支持误报分析、样本回流和后续模型效果优化。
- Foxglove 集成:配置 ROS 2 bag、MCAP 等数据源及消息通道,维护可视化布局,开发自定义面板展示目标轨迹、点云、车辆状态及事故标记。
- 时空对齐:处理不同传感器的时间戳、坐标系和外参关系,支持多源数据同步播放、关键帧定位和事故时间窗口切换。
- 分析复盘:支持场景录制、回放、截图和标注结果沉淀,方便算法、数据运营和研发团队协同复核事故样本。
项目成果
- 建成基于 Foxglove 的多传感器事故可视化分析平台,形成从数据解析到场景回放的统一工具链。
- 支持 Radar、Lidar 等传感器数据联合分析,提升事故定位和还原效率。
- 引入机器学习辅助事故判定,减少人工筛查成本,为真实事故识别和误报复核提供依据。
安全中台与车端数据服务
项目描述
面向事故监控、车端数据查询、保险存证等场景,建设统一的安全业务中台和车端数据中台。业务中台负责沉淀核心业务规则并屏蔽外部系统变化,数据中台负责车端数据加工、预热、查询和状态管理,通过标准 API、领域事件和适配层为多个业务系统提供复用能力。
我的职责
- 从 0 到 1 提出中台建设方案,完成内部宣讲、需求拉齐和技术方案落地。
- 负责中台系统架构设计、框架选型、DDD 领域建模、边界划分和研发规范建立。
- 负责业务中台、数据中台需求提炼及核心功能研发,推进领域能力沉淀和服务复用。
- 统一梳理服务接口、异步任务和数据处理链路,推动吞吐、延迟、成功率、队列积压、缓存命中率和失败重试等系统指标纳入监控。
技术方案与核心工作
- DDD 领域建模:根据业务边界拆分领域和模块,明确领域职责,降低业务逻辑之间的耦合。
- 统一服务抽象:将车端数据加工、预热、查询和状态管理沉淀为标准服务,统一接口参数、错误码、超时和重试边界,减少不同业务重复实现相同逻辑。
- 事件驱动:通过领域事件传递业务变化,解耦数据处理、状态更新和下游通知,为后续系统拆分和能力扩展提供基础。
- 第三方适配:采用适配器模式封装不同车端平台和外部系统差异,隔离外部接口变化对内部业务逻辑的影响。
- 并发处理:结合动态线程池和 Reactor 模式,支持数据处理任务的并发执行、资源动态调整和异步回调,避免单一慢任务阻塞整体链路。
- 缓存与预热:针对高频查询和重复读取场景设计数据预热与缓存策略,结合缓存命中率、查询耗时和数据新鲜度等指标调整预热任务。
- 稳定性与可观测性:围绕请求吞吐、P95/P99 处理延迟、任务成功率、队列积压、重试次数和资源使用率建立监控,配合幂等、超时、重试和业务降级处理异常流量。
项目成果
- 完成业务中台和数据中台架构从 0 到 1 设计与核心功能建设。
- 沉淀车端数据处理、预热、查询、状态管理和第三方适配能力,形成可复用的业务与数据服务。
- 建立统一 API、领域事件和适配层,支持多个业务系统按统一方式接入,减少重复业务逻辑和外部系统耦合。
- 建立覆盖吞吐、延迟、成功率、缓存命中率、队列积压和失败重试的系统指标体系,为容量评估、故障定位和降级决策提供依据。
- 建立 DDD 领域边界和统一研发规范,为后续模块扩展、独立部署和系统拆分提供基础。
NAD 保险存证系统
项目描述
为了在保险理赔和事故还原时能够完整获取车端数据,建设车端数据存证和调证系统,覆盖车端多条 DLB、DCL 等数据链路,并负责车端文件同步到云端。
我的职责
- 负责不同类型车端数据和文件的下载、存储及调证流程设计。
- 针对不同数据类型制定下载优化方案,处理大文件、并发下载和失败重试等场景。
- 负责核心数据链路的异常处理,保证数据下载和同步过程可恢复。
技术方案与核心工作
- 并发下载:采用多线程和异步处理提升不同类型数据的下载吞吐能力。
- 可靠性处理:建立重试、补偿和幂等机制,处理网络抖动、下载失败和重复请求等异常场景。
- 数据同步:打通车端文件提取、云端同步和后续调证流程,支持保险理赔场景下的数据还原。
项目成果
- 完成车端数据存储、文件同步和调证链路建设。
- 支持不同类型车端数据的并发下载和异常重试,满足事故数据完整获取需求。
事故分析报告
项目描述
为了完整还原事故场景,提取事故发生前后的车端数据,按照指定格式生成包含表格、图片和视频的事故分析报告,并支持不同车型和平台的数据拉取。
我的职责
- 负责系统设计、框架搭建和报告生成核心逻辑研发。
- 负责项目整体进度和风险把控,推进技术难点和跨模块依赖问题解决。
- 设计重复请求幂等、超时补偿和异步处理方案,覆盖报告生成过程中的异常场景。
技术方案与核心工作
- 多媒体处理:处理事故视频编码格式转换,统一不同来源视频的报告渲染和播放要求。
- 车型适配:采用策略模式封装不同车型、不同平台的数据拉取和报告生成逻辑。
- 异步生成:通过异步任务和超时补偿处理报告生成过程中的长耗时操作,避免同步请求阻塞。
项目成果
- 完成事故数据提取、报告渲染和多媒体展示链路建设。
- 支持不同车型和平台的数据拉取,沉淀可扩展的报告生成框架。
- 解决视频编码格式转换问题,并沉淀多媒体中心相关能力。
携程旅行网|票务与交易系统|开发经理|2017/03 ~ 2022/02
抢票订单与任务调度系统
项目描述
抢票业务的核心订单与任务调度系统,连接订单中心、抢票任务和票台,负责订单创建、订单加速、出票状态流转、预约秒杀策略下发及出票结果回传。系统同时承载大量订单任务扫描、任务分包、优先级排序和可控并发下发,需要在流量突增时兼顾出票时效、任务公平性和下游票台承载能力。
我的职责
- 参与系统架构设计、框架选型、业务拆分及监控埋点梳理,负责核心出票模块研发和项目技术推进。
- 设计重复请求幂等、超时补偿、业务异常恢复和高并发下单异步拆分方案。
- 负责预约秒杀订单排序、任务优先级调度和可控并发消费队列建设。
- 梳理订单、任务和出票结果的状态流转,定义任务生命周期、失败重试、超时回收和人工介入边界。
- 参与高峰期容量评估、流量观测和故障应急,推动订单吞吐、任务延迟、出票成功率和队列积压等指标纳入监控。
技术方案与核心工作
- 订单异步化:拆分下单、订单流转、任务生成和出票处理流程,通过消息队列与异步任务解耦前台请求和下游出票,缩短同步请求链路。
- 状态与幂等:围绕订单状态、任务状态和出票状态建立流转约束,结合业务唯一键、处理记录和重复请求校验,避免消息重放或接口重试造成重复出票。
- 并发控制:建设可控并发消费队列,支持线程数动态配置、任务启停、队列堆积观测和业务级/接口级异常补偿,按照票台承载能力控制下发速率。
- 任务调度:根据订单加速等级、预约时间和任务状态生成优先级队列,使用 Redis Sorted Set 排序,支持任务分包、分批下发和高优先级优先出票。
- 数据分片:采用分布式 Sharding 拆分订单和任务数据,结合索引优化、冷热数据隔离和批量查询,降低单表数据量及高峰期查询压力。
- 缓存优化:通过 Redis 缓存和内容压缩减少重复读取及大对象传输,针对高频订单和任务数据设计缓存更新、失效和降级策略。
- 稳定性治理:通过超时补偿、失败重试、任务回收、线路限流、业务降级和中间件依赖梳理,覆盖下游超时、消息重复、票台异常和流量突增等场景。
- 监控与扩容:围绕订单吞吐、任务等待时长、消费延迟、队列积压、出票成功率和接口错误率建设监控埋点,支持按业务模块水平扩容和问题定位。
项目成果
- 支撑系统平峰 30~50 万/min、节假日峰值 400 万/min 的流量。
- 预约秒杀场景性能提升 50%,出票率提升 5%。
- Redis 排序降低数据库读写压力 90% 以上,核心业务数据占用空间减少 70%。
- 完成订单、任务、出票状态和异常补偿链路建设,覆盖重复请求、超时、失败重试和任务回收等场景。
- 建立订单吞吐、任务延迟、队列积压、出票成功率和接口错误率等核心监控指标,支持高峰期容量评估和故障定位。
- 将任务调度、并发消费、缓存和分片能力模块化,支持业务按模块水平扩容。
监控与支付平台
项目描述
建设通用化业务监控和支付平台:监控队列积压、Redis 数据、SQL 业务数据和业务埋点,并接入支付宝、微信、招行等第三方支付,处理支付结果、重复支付和异常订单。
我的职责
- 负责监控系统表结构、规则模型和代码模块设计,支持短信、邮件模板及指定时间范围的阈值告警。
- 负责支付宝、微信和招行支付接入,处理支付结果查询、重复支付、无效支付和对账核销等流程。
- 参与支付高峰期性能优化和异常降级方案设计,保障支付链路连续运行。
技术方案与核心工作
- 通用监控:抽象队列、Redis、SQL 和业务埋点监控场景,支持按时间范围和阈值配置告警规则。
- 支付异步化:使用消息队列异步订阅和多线程查询支付结果,降低第三方支付通信抖动对主流程的影响。
- 异常处理:针对重复支付、支付超时和支付率下降场景,设计订单重置、告警和自动业务降级策略。
- 数据存储:按订单 ID 尾号分表,处理支付数据增长和单表数据量过大的问题。
项目成果
- 支付高峰支撑 2,000 单/min,完成多渠道支付接入和支付结果处理链路建设。
- 建成队列、缓存、SQL 和业务埋点的通用监控能力,支持短信和邮件告警。
- 完成重复支付、超时订单、自动降级和账单核销等异常场景处理。
账号与财务核销
项目描述
账号系统为其他业务提供注册、绑定、取换和账号同步能力;财务核销系统负责账单对账、无效/重复支付识别、核销及自动退款。
我的职责
- 参与账号系统从 .NET 到 Java 的重构和优化,负责账号标记、账号同步等功能研发。
- 负责支付报表、支付宝账单、代扣签约和负利润报表等财务功能开发。
- 处理十亿级账号数据、千万级财务数据和大批量数据修复场景。
技术方案与核心工作
- 账号分表:针对十亿级数据量进行分表设计,降低单表数据量和查询压力。
- 批量处理:设计通用 SQL 执行 Job,支持数据批量更新、修复和分批处理。
- 对账核销:采用临时表、分批取数和 MySQL 索引优化解决大数据量 Join、对账和核销超时问题。
- 利润计算:使用装饰者模式拆分订单附属品收益计算逻辑,实现负利润实时计算和告警。
项目成果
- 完成十亿级账号数据分表改造和账号同步能力建设。
- 支撑千万级财务数据的分批对账、核销和退款处理。
- 建立负利润实时计算和告警链路,完善支付及财务风险监控。
出票与支付客户端
项目描述
代售点出票系统负责纸质票和电子客票的后台收单、拉单、出票、打包和快递面单打印;支付客户端负责向第三方支付平台和银行发起多平台支付。
我的职责
- 负责新打印平台接入、出票流程改造和 .NET 到 Java 的部分系统重构。
- 负责多平台支付客户端的技术适配和自动化支付流程开发。
- 参与 Spring、Vue.js 等项目框架定型和设备通信方案落地。
技术方案与核心工作
- 打印链路:使用 TCP 通信、HTML 本地解析和打印驱动调试完成快递方式选择及打印指令下发。
- 支付自动化:使用 Selenium / ChromeDriver 自动化操作第三方支付平台,并通过 .NET Hook、WinAPI 调用支付 App API。
- 系统重构:完成部分 .NET 到 Java 的业务迁移,统一新打印平台和出票业务的接口调用。
项目成果
- 完成新打印平台接入,支持自动选择快递方式、生成面单并下发打印指令。
- 完成多平台支付客户端适配和部分核心系统重构。
- 相关打印能力获得公司创新项目认可。
开源项目
OpenMatrix|AI 任务编排与质量门禁框架
面向 AI Agent 和代码工程场景的自动化开发框架,提供 Plan、Code、Test、Review 等阶段编排,以及覆盖率、Lint、安全扫描、集成测试和 AI 验收等质量门禁。负责 TypeScript 核心架构、Agent 协作流程、运行时状态管理和质量报告闭环设计,支持多种质量模式和自动化执行。
MatrixCode|可配置工作流的 AI 代码助手
基于 Rust 构建的跨平台 AI Coding Agent,支持通过 YAML 定义条件分支、并行执行、失败重试和子工作流,提供 SQLite 跨会话记忆、多模型协作、工具系统、TUI、CLI 及 VS Code 扩展。负责 Agent runtime、工作流引擎、记忆系统和多 Provider 抽象设计,关注成本控制和本地化部署能力。
RPI / pi-rust|Rust 原生 Coding-Agent 框架
库优先的 Rust Agent runtime 和终端 CLI,拆分为模型 Provider、Agent Loop、Coding Tools、Session Harness、TUI 和插件 SDK 等模块,支持流式事件、会话持久化、工具扩展和稳定 ABI 插件加载。负责多 crate 分层架构、Agent / Tool 接口、会话运行时、插件 ABI 及 CLI 交互能力建设。
其他项目经历
- 2016/06 ~ 2017/03|上海中原物业顾问有限公司:参与 PTM / CTM 业绩报送和合同系统建设,负责业务梳理、技术选型、流程优化、员工培训及合同在线预览。
- 2015/02 ~ 2016/05|华住酒店集团:参与 CRM、粉丝平台和移动 BI 项目,负责报表、竞品数据、H5 邀请注册、用户画像、缓存预热和单点登录。
- 2014/07 ~ 2015/09|上海鸿翼软件技术股份有限公司:参与松下决裁、财务和勤务系统,负责工作流、报表、异常考勤、休假及工资单功能。
- 2013/07 ~ 2014/06|江苏物联网科技有限公司:参与农资物联网展示及溯源系统,负责 GIS 数据采集、WebGIS、进销存和门店收银功能。
教育经历
2009/09 ~ 2013/06|安徽建筑大学|资源环境与城乡规划管理