熊熊出没 发表于 2026-4-24 08:52:13

吴恩达老师开源翻译工作流Agent;阿里巴巴开源无需训练即可使用参考图像编辑图像的工具;Whisper Web 欣赏器字幕天生

✨ 1: Translation Agent

Translation Agent 吴恩达老师开源翻译工作流Agent
https://dis.qidao123.com/imgproxy/aHR0cHM6Ly9pLWJsb2cuY3NkbmltZy5jbi9ibG9nX21pZ3JhdGUvN2JmNjViZDgzNDY3OGI5MTA0ZjBlM2U0ZGU2ZTU2NzQuanBlZw==
Translation Agent 是一个基于反思工作流程的呆板翻译体系的Python树模。其告急步调包罗:

[*]使用大语言模子(LLM)将文本从source_language翻译到target_language;
[*]让LLM反思这次翻译并提出改进发起;
[*]依据这些发起改进翻译。
Translation Agent 是一个探索性项目,尚未成熟,旨在通过开放讨论、实行、研究和开源贡献来推动呆板翻译范畴的进步。
地点:https://github.com/andrewyng/translation-agent
✨ 2: MimicBrush

MimicBrush 阿里巴巴开源无需训练即可使用参考图像编辑图像的工具
https://dis.qidao123.com/imgproxy/aHR0cHM6Ly9pLWJsb2cuY3NkbmltZy5jbi9ibG9nX21pZ3JhdGUvMjkyOTZkOGJiMzU0MDhiMjgzOTY0ZmEzOGI2YTI1MjEuanBlZw==
MimicBrush是一种零样本图像编辑工具,通过参考图像举行模仿编辑,资助用户更方便地举行创作。该工具的核心在于用户只需指定源图像中的编辑地区(用白色蒙版标出),并提供一张预期编辑效果的参考图像。MimicBrush可以或许主动捕获两者之间的语义对应关系,并在一次操纵中完成编辑。
具体来说,MimicBrush通过在视频剪辑中随机选取两帧图像,一帧作为参考图像,另一帧作为源图像,对源图像的某些地区举行蒙版处置处罚,然后使用参考图像中的信息来规复这些蒙版地区。在训练过程中,它接纳了天生训练框架举行自监视学习,使其可以或许在差别图像间捕获语义对应关系。
实行效果表明,MimicBrush在各种测试案例中表现出较高的有效性,而且相较于现有的替换方案具有显着的良好性。研究职员还构建了一个基准来促进进一步的研究。
该工具展示了一系列多样化的编辑效果,包罗局部地区编辑、纹理转移和后期处置处罚优化等功能。MimicBrush的开辟团队来自香港大学、阿里巴巴团体和蚂蚁团体。
地点:https://github.com/ali-vilab/MimicBrush
✨ 3: Whisper Web

Whisper Web 是一个在欣赏器中运行的呆板学习语音辨认项目。
https://dis.qidao123.com/imgproxy/aHR0cHM6Ly9pLWJsb2cuY3NkbmltZy5jbi9ibG9nX21pZ3JhdGUvNWZlYzFmNjk5YzM2Yzg3N2NmZTBhOGViYWU0MzhhM2EuanBlZw==
Whisper Web 是一个基于呆板学习技能的网页端语音辨认工具,使用 🤗 Transformers.js 构建。它可以直接在欣赏器中举行语音辨认,无需安装额外的软件。
实时字幕天生:可用于在线集会、网络直播等场景,实时天生字幕,进步内容可访问性。
语音搜刮:在网页端实现语音输入搜刮,提拔用户体验。
语音智能助手:联合网页应用开辟智能语音助手,提供互动性更强的用户服务。
语音条记:在欣赏器中直接将语音转换为文本,方便集会记载和条记整理。
地点:https://github.com/xenova/whisper-web
✨ 4: Stable Diffusion 3 Medium

Stable Diffusion 3 Medium 开源的先辈文本天生图像模子
https://dis.qidao123.com/imgproxy/aHR0cHM6Ly9pLWJsb2cuY3NkbmltZy5jbi9ibG9nX21pZ3JhdGUvNjI0ODE2Y2M5ZjJkYTMwNzU2MzE3YjZkZTVmOTFlN2QuanBlZw==
Stability AI开源了Stable Diffusion 3 Medium模子,这是一个文本到图像天生模子,具有20亿个参数,可以或许在消耗级PC和条记本电脑以及企业级GPU上高效运行。该模子在图像质量、复杂提示明白和资源服从方面有显着提拔,具有Photorealism、Prompt Adherence、Typography等独特特性。模子使用多模态扩散变压器技能,训练数据包罗10亿张图像和大量精调数据。可以通过Stability平台上的API和Stable Artisan注册免费试用。
模子地点:https://huggingface.co/stabilityai/stable-diffusion-3-medium
地点:https://stability.ai/news/stable-diffusion-3-medium
✨ 5: SF-V

SF-V是一种通过单步天生高质量视频的新方法,显着低沉盘算资本。
https://dis.qidao123.com/imgproxy/aHR0cHM6Ly9pLWJsb2cuY3NkbmltZy5jbi9ibG9nX21pZ3JhdGUvM2Y3OGQxZjY4MzAwZjFlYmIwMDQ4ZjA4YTU3MWNlM2QuanBlZw==
SF-V(Single Forward Video Generation Model)是一种单步视频天生模子,旨在通过对预训练视频扩散模子举行对抗训练以优化视频天生过程。传统的基于扩散的方法必要多个去噪步调,盘算资本较高。而SF-V通过对抗训练,使多步视频扩散模子(如SVD)可以或许通过单次前向传播天生高质量视频,同时捕获视频数据中的时间和空间依赖关系。
地点:https://snap-research.github.io/SF-V/


页: [1]
查看完整版本: 吴恩达老师开源翻译工作流Agent;阿里巴巴开源无需训练即可使用参考图像编辑图像的工具;Whisper Web 欣赏器字幕天生