RAG算法专家
Why Work at Lenovo
We are Lenovo. We do what we say. We own what we do. We WOW our customers.
Lenovo is a US$83 billion revenue global technology powerhouse, ranked #153 in the Fortune Global 500, and serving millions of customers every day in 180 markets. Focused on a bold vision to deliver Smarter Technology for All, Lenovo has built on its success as the world’s largest PC company with a full-stack portfolio of AI-enabled, AI-ready, and AI-optimized devices (PCs, workstations, smartphones, tablets), infrastructure (server, storage, edge, high performance computing and software defined infrastructure), software, solutions, and services. Lenovo’s continued investment in world-changing innovation is building a more equitable, trustworthy, and smarter future for everyone, everywhere. Lenovo is listed on the Hong Kong stock exchange under Lenovo Group Limited (HKSE: 992) (ADR: LNVGY).
This transformation together with Lenovo’s world-changing innovation is building a more inclusive, trustworthy, and smarter future for everyone, everywhere. To find out more visit www.lenovo.com, and read about the latest news via our StoryHub.
Description and Requirements
岗位职责:
1. 负责企业级知识库RAG系统全栈研发与深度优化,主导结构化、非结构化、多模态知识库的搭建、治理与迭代,重点优化知识召回精准度、生成忠实度,解决大模型幻觉、知识滞后、溯源缺失等核心问题。
2. 构建并迭代大模型长短记忆体系,设计上下文记忆压缩、对话记忆沉淀、持久化知识记忆管理机制,实现动态记忆筛选、去重、更新与遗忘策略,提升长对话、多轮交互、长文本场景下的知识复用与上下文理解能力。
3. 搭建端到端高阶RAG技术链路,优化文档智能解析、自适应切片、精细化向量化、多路检索、重排序全流程,落地分层RAG、自适应RAG、Graph RAG等前沿架构;引入并落地LLM Wiki知识编译架构,突破传统切片检索范式,将碎片化原始文档自动聚合、梳理、迭代为结构化、可关联、可演进的主题知识百科页面,构建长效可迭代的知识库体系,大幅提升复杂专业场景推理与知识复用能力。
4. 自研多模态知识库解析引擎,统一解析图片、表格、图表、扫描件及混合版式文档,融合文本、版面布局、视觉信息联合编码,实现多模态知识的结构化沉淀与精准检索,拓展知识库的信息覆盖维度。
5. 主导检索体系升级,搭建稀疏检索(BM25/SPLADE)、稠密向量检索、知识图谱关联召回、深度重排的多路融合检索架构,设计自适应权重分配、结果融合与去重机制,平衡召回覆盖率、精度与推理速度。
6. 开展领域专属模型优化,针对知识库场景微调高质量领域Embedding模型、检索匹配模型与可信度判别模型,构建「知识库治理-检索优化-生成校验」的闭环迭代体系,持续提升专业问答效果。
7. 搭建RAG全链路自动化评测与可观测体系,围绕知识库覆盖率、记忆有效性、检索召回率、生成准确率、幻觉率、引用溯源准确率建立量化指标体系,依托线上数据与Bad Case持续驱动技术迭代。
岗位要求:
1. 扎实的大模型与深度学习功底,精通Python、PyTorch,熟练掌握LoRA、QLoRA等微调技术,具备领域Embedding模型、检索相关模型微调优化实战经验,熟悉模型量化与推理加速方案。
2. 精通高阶RAG核心原理与知识库体系,深入理解知识治理、文本切片策略、语义向量化、长短记忆机制,具备大规模企业知识库RAG系统从零搭建、落地迭代经验。
3. 熟练掌握主流RAG框架与向量数据库,精通LangChain、LlamaIndex等工具,熟练Milvus、Qdrant、ES、PGVector等数据库的性能调优,具备多路混合检索架构落地与调优能力。
4. 掌握前沿RAG与知识编译技术体系,深入理解LLM Wiki、自适应RAG、分层RAG、Graph RAG、自反思RAG核心原理,熟悉LLM Wiki“知识整编、跨页关联、增量更新、矛盾校验”的先进机制,可结合业务完成前沿技术选型、改造与落地,具备较强的知识库技术创新能力。
5. 具备多模态知识库工程能力,熟悉OCR版面分析、图文对齐、多模态语义融合技术,能够解决混合文档解析、模态信息冲突、语义对齐等工程难点。
6. 精通大模型记忆机制与长文本优化方案,具备上下文压缩、对话记忆管理、长文本检索优化实战经验,可有效解决超长上下文、多轮交互下的信息丢失与噪声问题。
7. 熟悉LLMOps/MLOps迭代流程,具备传统RAG与LLM Wiki知识体系的双范式搭建与融合落地能力,精通知识库数据清洗、知识整编、增量迭代、矛盾校验、量化评测全闭环,可通过Bad Case复盘持续优化检索、记忆与知识编译效果,具备良好的技术落地与团队协作能力。

