TGViewer
Channel Public Channel
DPS Build

DPS Build

@dps_build

AI, coding, data science and startups
Subscribers
1.01K
Photos
151
Videos
3
Links
492

Showing posts older than #271 · Back to latest

Older Posts 19 shown
Post #270 417
DPS Build 说出来不怕笑话,花了点时间,找到了 bug。 之前的写法使用 pandas.Series.apply,按行处理,等于是把 GPU 当 CPU 用; 修复之后,用了 pandas 的向量化操作,性能成倍提升。原先10000条数据用了7分28秒才算完,用上 mps 之后,只要26.9秒,提升了16倍。
花了一周时间完成了这个 assignment,记录了一下整个开发历程。

简单说来,就是给定一个数据集,然后做分类预测,预测的是文本和图片之间的相关性。但是这个数据集的特征非常有限,没有图片数据。

因为在短时间内抓取图片不现实,所以最后的方案就是在数据集做各种 feature engineering,embedding 对于整体提升非常大。

当然 overfitting 也比较明显,如果有更多时间,肯定需要在这方面下更多功夫。

如果大家有什么建议,也请赐教。

https://letters.acacess.com/ltr/
Daily Productivity Sharing A Machine Learning Assignment Note Recently I received a machine learning assignment: The goal of this assignment is to predict if an image is relevant or not, given a text query. More details about this assignment: The classical search system takes in a query, generates K candidates…
Post #267 425
在两台 Mac 时间使用 Thunderbolt 线传输数据

因为有很多数据要在两台 Mac 之间传输,自然想到了用传输速度很快的雷电线,结果并不容易。

1. 需要将其中一台 Mac 重启,变成 share disk 模式

2. 从另外一台 Mac 的Finder中查找 Network,才能找到已经用雷电线连接的 share disk

如果数据量不大,还真不如 AirDrop 方便 🤷

https://support.apple.com/en-sg/guide/mac-help/mchlb37e8ca7/mac

https://support.apple.com/en-sg/guide/mac-help/mchlp1443/mac
Apple Support Transfer files between a Mac with Apple silicon and another Mac On a Mac with Apple silicon, use Mac Sharing to connect to another Mac and transfer files.
Post #265 346

Forwarded from DPS Main

Daily Productive Sharing 839 - Experience Makes Coders Better

https://letters.acacess.com/daily-productive-sharing-839/

Addy Osmani 认为不断的新项目会一直促进程序员成长:
1 单独掌握一门工具或者技术并不能凸显他们的价值,当一个程序员能把这些不同的工具或者技术融汇贯通,他们才会有更大的价值;
2 知道何时用一门工具,如何合理地使用一门工具,才是对程序员的考验;
3 随着时间的推移,程序员的经验会越来越多,也就能更好地组合使用不同的工具;

至于如何更好地积攒经验,Addy 也给出了一些具体建议:

1 每做完一个项目,都要回顾,最好记录下来;
2 尝试着帮助别人,也尝试着向别人求助;
3 多参与到社区中去,多参与到开源项目中去;
4 永远不要停止学习。
Post #264 305

Forwarded from DPS Main

Daily Productive Sharing 838 - What Makes Documentation Good

https://letters.acacess.com/daily-productive-sharing-838/

OpenAI 的技术文档质量相当高,这是为什么呢?Ted Sanders 介绍了他们的一些最佳实践,整篇介绍也是一份质量极高的文档,我们摘录一些最值得借鉴的:

1 写文档要从读者出发 -- 技术文档要让读者快速找到他们想要的信息,所以撰写时就要时刻考虑这一点。 比如要准备目录,要把主题放在每一段的第一句的开头,要让每一段变得精练,多用列表;

2 文档要简单易读 -- 避免使用术语,要用简单句,要考虑语法结构,要避免跨段使用代词。总之要减轻读者的认知负担;

3 要考虑文档的覆盖性 -- 要假设读者对这一话题一无所知,这样的文档技能帮到初学者,也能帮到有经验的人;要写尽量覆盖更多方面的文档,而不是 edge case 的文档。
  • 👍 2
Post #261 389
说出来不怕笑话,花了点时间,找到了 bug。

之前的写法使用 pandas.Series.apply,按行处理,等于是把 GPU 当 CPU 用;

修复之后,用了 pandas 的向量化操作,性能成倍提升。原先10000条数据用了7分28秒才算完,用上 mps 之后,只要26.9秒,提升了16倍。
  • 👍 3
Post #260 379
CPU_vs_GPU.png806.5 KB
不知道是不是我什么地方配置有问题,在 M2 Max 上跑同样的任务,GPU 居然比 CPU 慢

具体配置是 M2 Max,CPU 是12核,GPU 是30核。

跑的任务是 sentence-transformers 做 embedding,底层调用 PyToch。

sentence-transformer 的版本是 2.2.2
PyTorch 版本是 2.1.0
Python 版本 3.11.6
Jupyterlab 版本 4.0.7

有哪位知道的话,请不吝赐教
  • 🤔 1
Post #259 428
刚好有朋友问如何准备面试系统设计

1. 首选的当然是 Alex Xu 的 System Design Interview – An insider's guide。目前已经出到第二版了。这本适合快速入门,积攒面试技巧;

2. 如果你面试的职位和数据相关,建议翻翻 DDIA - Designing Data-Intensive Applications。

3. 如果你面试的职位和机器学习相关,建议翻翻 DMLS - Designing Machine Learning Systems,去年新出的书,质量比肩上门这本,非常推荐。

https://t.me/tms_ur_way/2047

https://dataintensive.net/
Telegram DPS Main 花了两周时间终于把 Designining Machine Learning Systems (DMLS) 翻完了。和我最初的感觉一样,这本书可以比肩 Designing Data Intensive Application (DDIA。 这本书详细地介绍了搭建一个生产级机器学习产品的全过程,从准备数据,训练模型,上线模型,线上训练到不断地迭代都做了详细介绍。大部分经验都是在学校里或者小公司学不到的经验。非常扎实,而且没什么废话。 https://www.oreilly.com/library/view/designing…
  • 👍 1
Post #258 836
为了突破各国管制,Del Complex 直接把 GPU 数据中心放到了公海上。

1. 有10000 张 Nvidia H100 显卡
2. 使用太阳能供电,水冷冷却
3. 不仅是计算平台,每一个还是一个独立的国家🤣,可以享受税收减免。

https://x.com/delcomplex/status/1719087956311396481
X (formerly Twitter) Del Complex (@DelComplex) on X Announcing: BlueSea Frontier Compute Cluster The Biden admin's AI Executive Order and the EU’s AI Act aim to centralize control under guise of safety The solution is at sea. BSFCC's are not just barge based compute platforms, but sovereign nation states…
  • 🤯 2
Post #256 464
如何修复 Jupyter Notebook 在 Pyenv 下找不到 kernal 的问题:

1. 使用 jupyter kernelspec list 这一命令,找到错误信息中指定 kernel 的文件,可能会有多个 kernel.json 文件,需要定位到具体的那一个;

2. 直接在具体的那个 kernel.json 文件里修改正确的 Python 版本。

3. 重新启动 Jupyter,问题就应该修复了

https://queirozf.com/entries/jupyter-kernels-how-to-add-change-remove
Post #255 469
Post #254 498
翻了一个很蠢的错误:

从本地连远程的数据库一直连不上,还以为是密码什么的搞错了。 搜 error message,看到 stackoverflow 上说,有可能是防火墙问题,也有可能是证书问题。

先改了证书,还是不行;换了一台机器,居然可以连上。于是怀疑还是防火墙的问题。一查,果然是在 Lulu 里随手设置了禁止所有访问的规则😂

https://objective-see.org/products/lulu.html
Post #251 372

Forwarded from DPS Main

Aquired 最近采访了 Nvidia 总裁黄仁勋,非常有启发:

1. 黄仁勋说他如果回到年轻的时候,他绝对不会选择创业。之所以创业,是因为不知道有这么难,但实际比想象要难得多。之所以能撑下来,是因为一直不断地告诉自己,没那么难;

2. 关于公司架构,他信奉的是 mission is the boss,所以 Nvidia 的公司架构和一台电脑一样。也因为这样,信息在 Nvidia 内部传播的非常迅速,没有什么信息壁垒。

3. 领导企业主要就是把控方向,尽可能跟上市场。哪怕不是摘到苹果的那个公司,也要做到是那家捡到苹果的公司。所以 CEO 最重要的任务就是找准公司的定位,也就是 Carveth Read 所说的 It’s better to be approximately right than exactly wrong;

4. CUDA 不仅被应用在深度学习里,其实早就被广泛应用在各种科学计算中。正是 CUDA 普及,帮助 Nvidia 到显卡在科学领域占据了统治地位;

5. 他很喜欢 Star Trek,但是从来不读科幻小说 😂

https://www.acquired.fm/episodes/jensen-huang
www.acquired.fm NVIDIA CEO Jensen Huang | Acquired Jensen Huang on founding Nvidia, building the datacenter business, creating CUDA, and betting the company multiple times. How he saw AI's future first.
  • ❤ 1
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →