Skip to content

Latest commit

 

History

202 Commits

Folders and files

NameName
Last commit message
Last commit date
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 

Repository files navigation

Oh I Know

Oh I Know 是一个基于大语言模型与先进音频处理技术的知识发现与交互平台。通过对非结构化视频和图文数据的深度拆解,平台实现了从“信息接收”到“语义交互”的转变,支持多平台内容聚合、精准时间轴定位以及基于用户偏好的知识内化。

视频交互与语义检索

平台通过技术手段解决了视频内容难以检索和快速消化的痛点。

  • 毫秒级时间轴跳转:系统通过 WhisperX 实现单词级语音与文本强制对齐,自动提取视频关键时间节点的摘要。用户可直接点击摘要文本,跳转至对应的视频帧,实现非线性内容消费。
  • 视频内自然语言定位 (In-Video Q&A):支持针对视频内容的语义提问。例如:“视频中关于 Gemini 3.1 Pro 的核心架构是在哪一分钟提到的?”系统通过 RAG(检索增强生成)在视频转录文本中检索对应片段,并指引用户跳转。
  • 多维向量语义搜索:基于向量数据库实现的搜索系统不再依赖传统的关键词匹配。用户可以通过描述性自然语言进行搜索,系统将根据语义相关性跨平台匹配 YouTube、X、Reddit 等来源的内容。

个性化发现与知识管理

系统通过动态用户画像分析,实现内容的精准分发与知识沉淀。项目的核心特性在于其跨平台、多源内容的深度聚合能力,能将不同来源(YouTube、X、Reddit、StackOverflow)的碎片化信息,针对同一主题进行结构化的知识总结,而非仅仅是简单的信息陈列。

  • 多源异构内容聚合与知识总结:这是系统的核心竞争力。系统能够自动识别并关联不同平台上关于同一技术的讨论或同类型的视频内容,通过 LLM 深度提取并汇总这些多源信息,生成一份连贯、结构化的知识总结(而非简单的对比笔记)。总结中包含指向原始视频或帖子的精准时间戳锚点,确保所有技术结论均可追溯至原作者。
  • 动态用户偏好热榜:搜索热榜并非静态排名,而是根据用户的近期观看历史与技术兴趣点动态生成。如果用户近期频繁接触人工智能领域,热榜将自动聚焦该领域的最新趋势、技术挑战或实战教程,且均以自然语言建议的形式呈现。
  • 定制化关键词流:支持根据用户设定的垂直领域关键词(如分布式系统、内核开发等)构建专属信息流,自动汇聚多源平台的相关内容。
  • 风格化改写与处理:支持通过自然语言指令对生成的知识总结进行风格调整(如技术简报、小红书笔记风格、扩写或精简),并支持多格式导出与分享。
  • 原音特征保留的语音合成:通过 IndexTTS 技术在翻译过程中保留原作者的音色特征与情感波动,降低跨语言学习的认知门槛。

跨平台支持

基于 Flutter 框架构建,Oh I Know 实现了“一次开发,全端部署”的高效开发模式,全面支持以下平台:

  • 移动端:Android, iOS
  • 桌面端:macOS, Windows, Linux
  • 新兴系统:支持鸿蒙系统 (HarmonyOS) 的适配与部署

后端实现逻辑与系统架构

系统的核心由一套复杂的 AI 处理流水线(Pipeline)组成,涵盖了从数据抓取到向量检索的全过程。

技术组件说明

  • WhisperX:用于实现高精度的语音识别与强制对齐(Forced Alignment),是实现时间轴精准定位的核心。
  • IndexTTS:负责带有情感特征迁移的语音合成,确保翻译后的配音保留原音特质。
  • DDS (Dynamic Discovery Service):动态内容发现系统,负责外部平台数据的实时抓取、清洗与结构化。
  • Vector DB (Embedding Engine):利用向量数据库存储全量的语义特征(Embeddings),支撑语义搜索、视频定位及个性化推荐。

内容处理与交互流程图

graph TD
    subgraph ingestion ["数据接入层 (Ingestion)"]
        A1["YouTube 视频流"] --> A
        A2["X / Reddit / SO 文本"] --> A
        A["DDS: 动态发现与数据清洗"] --> B{"内容类型分配"}
    end

    subgraph video_pipeline ["视频深度处理流水线 (Video Pipeline)"]
        B -- 视频 --> V1["WhisperX: 语音识别与单词对齐"]
        V1 --> V2["LLM: 语义分割与关键里程碑生成"]
        V2 --> V3["IndexTTS: 情感特征迁移与翻译配音"]
    end

    subgraph text_pipeline ["文本结构化流水线 (Text Pipeline)"]
        B -- 文本 --> T1["LLM: 核心语义提炼"]
        T1 --> T2["多维标签化与元数据提取"]
    end

    subgraph storage_retrieval ["知识存储与检索层 (Storage & Retrieval)"]
        V2 & T2 --> S1["Embedding Model: 向量化转换"]
        S1 --> S2["Vector DB: 向量索引存储"]
        V2 & T2 --> S3["Relational DB: 元数据与关系存储"]
    end

    subgraph application_logic ["应用逻辑层 (Application Logic)"]
        U1["用户交互: 搜索/提问/观看"] --> L1["用户画像与偏好分析"]
        L1 --> L2["个性化热榜生成"]
        L1 --> L3["推荐流过滤"]
        U1 -- 提问/搜索 --> R1["RAG: 向量检索与上下文构建"]
        R1 --> R2["LLM: 内容定位与结果生成"]
    end

    subgraph presentation ["展现层 (Presentation)"]
        L2 & L3 & R2 --> P1["Flutter 应用界面"]
        P1 --> P2["精准时间轴跳转/风格改写/导出"]
    end
Loading

About

No description or website provided.

Topics

Resources

Stars

5 stars

Watchers

0 watching

Forks

Releases

Packages

Used by

Contributors

Languages