视频、播客很不方便查阅,因此我一直有在看“视频转图文教程”的需求与大模型实现。
现在便宜模型已经能做七成了,而且不只是图文,它能用工具剪辑片段视频,对一些教程类有用。
我过段时间应该能做一个「AIY工具」的对应功能。网页链接
剩下三成的差距主要在:1️⃣偶尔抓不到一些片段信息2️⃣说话老是会把思考片段加进去,比如“按原字幕复述即可:”、“这一段包含明显的连续动作,所以保留短片:”3️⃣还有这个模型偶尔会脑抽,比如图二的“第一只”识别成“第二只”
就感觉拿去卖,还差一点;用户让AI做着自己用(AIY),倒还行。

