上一周基本跑通了整个流程,也拿到一些结果,但有一个问题始终困扰着我:
用 whisper-mlx 把录音转成中文后,所有的标点都丢失了,英语倒还好。这样以来,问题很大,因为 whisper 的模型是根据根据时间窗口切割结果的,比如3秒,10秒之类的,但没有标点就无法重新分句,只能硬拿3秒10秒这样的切块和英语做对比。尽管也能看出一些眉目(抄得太厉害了),但总归难以说服自己。
我一开始想直接在切块里添加标点,然后再分句。但这样的问题很大,每个切块都是破损的,这样直接喂给模型,效果还是很差。后来我想,要不干脆直接把所有一段录音的所有切块直接拼在一起,然后再添加标点,再分句。查了查,还真有人这么玩过,而且还有专门的模型。结果拿来一试,不光分句的问题解决了,后续的问题也解决了不少。
有了 agent,这就是一两小时的事,没有 agent,恐怕是一两周的活。
Post #705
760
DPS Build 不少人问我怎么弄的,确实所有的代码都是 vibe code 的,不是两三个 skill 能讲清楚的。 这几天重温了很多 NLP 的算法,以前要搞清楚一个算法细节,需要读论文,找实现,标注数据,做实验,反复好几轮。有了 agent 之后,迭代速度快多了,但是大方向还是需要人来把控。 就像一个完全写过代码的人完全不知道有 git 一样,如果之前没有那么多年的 nlp 经验,我也不可能这么快地指挥 agent 干活。同理,现在上手前端项目,对我来说还是有许多未知的。 所以么,我当然看得到 AI 的潜力,但…